Claude Fable 5真的被越狱了吗?Pliny多智能体Pack Hunt攻击与12万字符系统提示词泄露全解析
Anthropic最强大的Mythos级模型Claude Fable 5在发布48小时内被安全研究员Pliny the Liberator用'pack hunt'多智能体协同攻击绕过安全层,并泄露了完整12万字符系统提示词。Anthropic否认这是真正的越狱。
核心结论
如果你在搜「Claude Fable 5 被破解了吗」,简短答案是:Anthropic 最强大的 Mythos 级模型在发布 48 小时内,被安全研究员 Pliny the Liberator 用"pack hunt"多智能体协同攻击绕过了安全层,并泄露了完整的 12 万字符系统提示词。Anthropic 否认这是"真正的越狱",但无论真相如何,这件事对 AI 编码工具用户有三个直接影响:你的编码助手背后有一整套你看不到的治理系统在运行;多智能体攻击正在成为破解前沿模型的有效手段;而最强大的模型随时可能因为安全原因被下线。
48 小时时间线
2026 年 6 月 9 日,Anthropic 发布了 Claude Fable 5——首个面向公众开放的 Mythos 级模型,在 SWE-bench Pro(80.3%)和 Cognition FrontierCode 等编码基准测试中创下最高分。公司强调了其安全性:超过 1000 小时的外部漏洞赏金测试"未发现通用越狱方法"。
48 小时内,这个叙事崩塌了。
6 月 10 日,知名 AI 红队研究员 Pliny the Liberator 将 Fable 5 的完整系统提示词——全部 120,040 个字符——发布到了 GitHub 和 X 平台。一天后,他贴出了截图,展示 Fable 5 遵从了本应被阻止的请求,包括逐步生成栈缓冲区溢出攻击代码的指令。
Pliny 使用的方法让这次事件有了特殊意义。他没有使用单个巧妙的提示词,而是部署了"pack hunt"——一种协同多智能体攻击策略,多个角色身份和叙事框架协同工作,让 Fable 5 的安全分类器陷入混乱。攻击结合了 Unicode 技巧、长上下文引用追踪和文档式叙事框架,成功绕过了模型的安全路由系统。
Anthropic 的回应:"这不是真正的越狱
Anthropic 强烈反驳。公司发表声明拒绝了 Pliny 的说法,认为这次攻击利用的是设计约束而非安全漏洞。公司表示其高级分类器系统将这些请求路由到了限制有害输出的安全机制,Pliny 所展示的遵从是"不完整的"。
但损害已经造成。系统提示词泄露——无论你是否认为这次绕过是"真正越狱"——将 Anthropic 的内部治理架构暴露在了全世界面前。6 月 12 日,美国商务部发布出口管制指令,迫使 Anthropic 暂停全球所有客户对 Fable 5 和 Mythos 5 的访问权限。
12 万字符系统提示词揭示了什么
安全研究机构 ayautomate.com 对泄露提示词的分析总结出九条对 AI 开发者至关重要的发现:
-
以工具为中心的架构:Fable 5 的行为围绕工具组织,而非单纯对话。每个能力——文件操作、网页搜索、代码执行——都是具有明确权限边界的工具。
-
命名的注入攻击:Anthropic 内部命名并分类了提示注入攻击向量,表明问题已被充分理解但尚未完全解决。
-
安全路由系统:模型使用多层路由系统,安全分类器在请求到达核心模型之前对其评估。"pack hunt"正是通过扰乱这个路由器取得了成功。
-
日期感知角色:Fable 5 被指示以"2026 年 1 月的高度知情者"身份回答问题——这种知识截断框架会影响其处理时间敏感型编码问题的方式。
-
Artifact 和 Canvas 边界:不同的输出模式(代码组件、文档画布)具有不同的权限集,为红队人员创造了可探测的攻击面。
-
搜索工具治理:网页搜索结果必须被引用且不能编造——这一约束影响了开发者粘贴错误日志进行调试的工作流。
-
版权和归属规则:模型有关于复制受版权保护代码的明确指令,这直接关系到 AI 编码工具用户的日常使用。
-
用户福祉指令:提示词包含心理健康危机检测和响应路由的专门章节,揭示了超越纯粹功能性的运营优先级。
-
自我参照意识:Fable 5 被要求一致地指代自身并承认其局限性——泄露的提示词让这类治理层变得完全透明。
这对 AI 编码工具用户意味着什么
如果你使用 Claude Code、Cursor 中的 Claude 集成、GitHub Copilot 的 Claude 后端,或任何由 Anthropic 模型驱动的 AI 编码助手,Fable 5 事件对你意味着:
你的 AI 助手有一套你看不到的庞大治理系统。 12 万字符的系统提示词本质上是一份运行手册,在你收到的每个回复之前执行。当你的 AI 编码工具拒绝生成某些代码模式、或给你一个模糊的安全警告时,你触发的正是这些层级——而泄露的提示词精确揭示了它们如何运作。
多智能体攻击是真实有效的。 Pliny 的"pack hunt"技术不仅是越狱领域的趣闻——它证明了协同多智能体方法可以击败单一模型的安全系统。随着 AI 编码工作流越来越多地使用智能体集群(子智能体、委托任务、并行工作器),攻击面正在急剧扩大。
安全与能力之间是持续的拉锯战。 Anthropic 因安全问题暂停了其最强大的模型。如果你的工作流依赖前沿模型的能力,你需要备用策略。Opus 4.8 仍然可用,但它在 SWE-bench Pro 上的得分低了 11 个百分点。
系统提示词正在成为公共知识。 这次泄露确立了一个模式:前沿模型的系统提示词终将被提取并公开。这种透明度对安全研究有益,但也创造了猫捉老鼠的动态——模型提供商必须不断更新其治理层。
更大的图景
Anthropic 的 Fable 5 传奇——发布、越狱、系统提示词泄露、隐形护栏争议、政府强制下线——不仅仅是一场公关危机。这是对整个前沿 AI 部署模式的一次压力测试。
当一个模型既是有史以来最强大的编码助手,又危险到美国政府认为不能允许无限制访问时,AI 编码社区面临一个令人不安的问题:我们愿意为安全牺牲多少能力?而谁有权做这个决定?
目前,务实的答案很明确:Claude Fable 5 和 Mythos 5 已经下线。如果你的编码工作依赖它们,最好的替代方案是 Claude Opus 4.8(仍可用,每百万 token 5/25 美元)、GPT-5.5 或 DeepSeek V4 Pro。而那 12 万字符的系统提示词,如今保存在 GitHub 仓库中,将在未来多年被安全研究者和 AI 开发者持续研究。
主题中心
2026 AI 编程工具全景指南
从 Copilot 改版到 Claude Code / DeepSeek 低成本方案——把分散资讯收成可搜索、可对比的工具矩阵。
进入「2026 AI 编程工具全景指南」 →赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →