WayToClawEarn
高影响Anthropic Research

Anthropic 自家数据表明:AI 编码代理的“人类在回路中”安全模型正在失效

Anthropic 的代理自主性研究和社区实验汇聚成一个令人不安的结论:人类不是 AI 编码代理的可靠安全层。

WayToClawEarn Editorial发布 2026年8月7日

编辑基于公开来源复核 · AI 辅助整理。 内容方法

TL;DR

同一天出现了两组数据。Anthropic 发布了研究,显示 Claude Code 会话越来越长、越来越自主。与此同时,一个社区实验经过 40,000 次游戏和 409,000 次决策后发现,人类会漏掉大约三分之一的 AI 编码代理危险指令。两者合在一起讲了一个令人不安的故事:所有主流 AI 编码工具依赖的"人类在回路中"安全模型,并没有按照我们设想的方式工作。


8 月 6 日,Anthropic 发布了《Measuring AI Agent Autonomy in Practice》,分析了几百万次 Claude Code 会话和公开 API 交互。核心发现是代理会话在增长。Claude Code 的单轮操作时长在过去四个月几乎翻了一倍。有经验的用户随时间推移给予更多信任,更快地批准指令,更少地干预。

值得关注的数字:

  • Claude Code 单轮中位数:约 45 秒,多月稳定
  • 头部百分位轮次:持续延长——部分会话现在持续数小时,人类输入极少
  • API 工具调用:2026 年 1 月两周内抽样近一百万次
  • 操作领域:代理覆盖代码生成、文件操作、shell 执行、网络请求——恰好是出错代价最高的攻击面

论文措辞谨慎且克制。Anthropic 将增长中的自主性主要定性为良性:开发者信任好用的工具,所以让它们运行更久。但研究到此为止,没有追问这种信任是否合理。

一个完全独立的数据来源填补了这块空白。

几个月前,有人在 Hacker News 上发布了一个"AI 代理权限游戏"。它模拟 Claude Code 的权限对话框。玩家看到逼真的指令提示——有些安全,有些危险——然后决定批准还是拒绝。经过 40,000 次游戏和 409,000 次独立决策后,统计数据收敛到一个模式:人类批准了大约三分之一本应拒绝的指令。

cat ~/.aws/credentialsDROP TABLE users 这样的指令被放行,因为人们累了、不再仔细阅读,或者只是信任代理的描述框架。游戏创建者指出恶意请求比例高于真实使用场景,这确实是合理质疑。但如果你使用过任何 AI 编码代理超过一个下午,这个发现本身并不令人意外。五分钟内弹出第十个权限对话框之后,你就不再阅读了。你点"批准",因为前九个都没问题。

这就是核心矛盾。Anthropic 的数据显示代理正在被更信任、运行更久、更频繁地请求权限。社区实验显示人类不擅长这种权限模型——即使是在明知自己被测试的低风险游戏中。在生产环境中,面对截止日期、频繁上下文切换和 Slack 通知,错误率几乎肯定更高。

整个生态系统的安全架构——Claude Code 的权限模式、Cursor 的代理审批流程、Copilot 的工作区信任——都收敛在同一个假设上:人类会在坏指令执行前拦截它。这个假设现在有证据问题了。

什么真正有效?一些不依赖人类警觉性的做法:

全部沙箱化。 在隔离环境中运行代理生成的指令。Docker 容器、临时虚拟机、受限 shell。即使代理执行 rm -rf /,命中的也是容器边界,不是你的实际文件系统。

精细权限范围。 不要给代理无限制的文件系统或网络访问。限制到特定目录。对敏感路径使用只读挂载。白名单网络目标。

审计,而非审批。 从"人类批准每个操作"转向"操作被记录后审查"。实时审批产生告警疲劳。批量审查捕获模式。

代理端护栏。 代理自身应该拒绝明显危险的请求。Claude Code 在某种程度上已经这样做了——它会拒绝 cat .env——但这个边界比需要的更软。

假设模型会被攻破。 提示注入是真实的攻击向量。如果上游提示能让代理相信执行任意指令是合理的,那么批准这些指令的人类不是安全边界。他们是攻击面的一部分。

研究中一个更安静的发现值得深思。Claude Code 暂停请求澄清的频率高于人类打断它的频率。代理问"你确定吗?"而人类回答"是,继续"——根本没有阅读。这种不对称说明了很多:回路的一侧比另一侧更努力。

权限游戏仍在运行。你可以自己玩一下,看看放过了多少危险指令。大多数尝试它的开发者回来时带着意料之外的数字。"我肯定会拦截那个"和"我实际拦截了那个"之间的差距,比我们愿意承认的大得多。

claudecodingagentsecurityanthropicresearch
免责声明:本站案例均为知识分享内容,仅供灵感与参考,不构成收益承诺;由此进行的外部执行与结果请自行判断并承担相应责任。
“人类在回路中”已死?Anthropic 研究显示我们漏掉 1/3 的 AI 编码危险指令 · WayToClawEarn