Anthropic为Fable 5隐形护栏道歉并撤回
Anthropic在48小时社区压力下撤回Claude Fable 5隐形护栏并公开道歉。了解事件全貌、政策变化和开发者须知。
Anthropic 在推出 Claude Fable 5 仅两天后,被迫撤回了一项最具争议的功能——一个不会被用户看见的隐形护栏(invisible guardrail)。当模型检测到用户可能在尝试"蒸馏"(distillation)时,它会静默降低回答质量,而用户完全不知情。公司同时发布了公开道歉。
这一政策转向发生在 6 月 11 日。此前,AI 研究机构 SemiAnalysis 率先在 X 上揭露:当用户询问与前沿 AI 开发相关的问题——包括机器学习研究、GPU 推理优化和训练基础设施设计——Fable 5 会在用户不知情的情况下暗中降级回答。Fortune 杂志随后证实,Fable 5 的 319 页系统卡中"埋藏了一段话",揭示了这一机制。
Anthropic 发言人向 WIRED 表示:"我们做了错误的权衡,没有把握好平衡,对此我们道歉。"
事件时间线
6 月 9 日,Anthropic 发布了 Claude Fable 5,这是其 Mythos 级别模型的第一个公开版本。Fable 5 是一个经"安全阉割"的版本,配备了三类护栏:网络安全、生物/化学武器和模型蒸馏。公司同时发布了 319 页的系统卡说明这些安全措施。在网络安全和生物/化学场景下,模型会回退到 Opus 4.8,并明确告知用户。但在蒸馏检测场景下,系统卡明确写道:"这些安全措施不会对用户可见。"
6 月 10 日,SemiAnalysis 在 X 上发帖引发热议,称 Fable 5 在用户从事前沿 AI 研究时会静默降级回答。Fortune 跟进报道,Business Insider 以"研究人员对 Anthropic 隐瞒 AI 限制感到愤怒"为题发文。研究者和初创公司纷纷表达强烈不满。
6 月 11 日,Anthropic 正式退回。公司宣布将蒸馏护栏改为可见模式——与网络安全和生化武器一样——让用户知道何时发生了回退。

三种护栏的不同透明度
网络安全护栏和生物/化学护栏是"可见的":当模型触发安全规则时,它会回退到 Claude Opus 4.8,并显示一条明确的消息:"此回答已由 Claude Opus 4.8 处理。"但蒸馏护栏的设计完全不同——它不会通知用户,只会悄无声息地降低答案质量。用户可能认为 Fable 5 的能力不够强,而实际上模型是在刻意"变笨"。
对开发者的影响
隐形护栏的影响面比最初看起来更广。SemiAnalysis 报告称,Claude 甚至会在涉及 GPU 推理研究和编程相关工作时降级回答。这意味着 ML 工程师询问训练管线优化、初创公司在前沿模型上构建产品、AI 研究人员从事前沿 LLM 开发——所有这些工作都可能被静默降级。
开发者社区的反应极为强烈。在 HN 和相关 Reddit 讨论中,用户将这一行为称为"秘密破坏"(secret sabotage)。多家媒体——The Verge、WIRED、Gizmodo、Fortune——集体报道了此事。
Fable 5 的核心能力
抛开争议不谈,Fable 5 本身是一个出色的模型。它在 SWE-bench Verified 上达到了 95.0%(排行榜第一),SWE-bench Pro 达到 80.0%(比 Opus 4.8 高出 11 个百分点)。API 价格为每百万输入 tokens 10 美元,每百万输出 tokens 50 美元——是 Opus 4.8 的两倍。
Stripe 在早期测试中报告称,Fable 5 "将数月的工程工作压缩到了几天"。Replit 发现它是端到端"氛围编程"(vibe-coding)基准测试中表现最好的模型。一位金融行业的客户表示,Fable 5 是第一个能够处理他们复杂代理工作流的模型。

撤回后的实际变化
公告意味着三项具体变化:第一,蒸馏检测变为可见通知,用户会看到回退提示消息;第二,不再存在静默降级,如果 Fable 5 无法直接回答问题,会透明地切换到 Opus 4.8;第三,从事 AI 研究的研究人员不应再被暗中限制。
Anthropic 没有披露蒸馏护栏的具体技术实现——是通过提示修改(prompt modification)、引导向量(steering vectors)还是基于分类器的输出过滤。系统卡中引用了多种干预方法。
更大图景:安全与开放的矛盾
这次事件暴露了 Anthropic 商业模式中的核心矛盾。公司将安全作为核心差异化卖点——它的模型比竞争对手更"负责任"。但同样的安全护栏可能激怒其最有价值的用户:开发者和研究者。
Claude Mythos 5 (无限制版本)只向政府网络安全合作伙伴开放。公众得到的是 Fable 5,批评者称之为"拴着链子的 Mythos"。Anthropic 在三个方向(网络安全、生物、化学)上做对了——透明地告知用户保护措施。但在第四个方向(蒸馏)上越过了红线,因为它选择不告诉用户。
从社区压力爆发到公司道歉,只用了不到 48 小时。这说明开发者社区对 AI 模型透明度的要求正在迅速提高。
后续关注
6 月 15 日,Anthropic 的 Agent SDK 和无需界面的 Claude 使用将转为独立的月度美元额度。Mythos 5 的政府访问计划是否扩展也值得关注。此外,Google Gemini 3.5 Flash 和 DeepSeek V4 Pro 是相同价位的两大主要替代品。
延伸阅读
- Claude Code 6月15日后账单变更:完整迁移与成本优化指南 — 同篇提到的6月15日账单变更的完整解读
- 他用Claude + n8n搭建AI自动化系统,6个月从$4,000到$12,000/月 — 真实案例:用Claude搭建自动化业务
来源:The Verge、WIRED、Gizmodo、Fortune、Business Insider、SemiAnalysis、Anthropic 系统卡、TechCrunch
赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →