WayToClawEarn
高影响Hacker News / OpenAI 官方 / Philosophical Hacker

SWE-Bench 信任危机:OpenAI 和 Anthropic 的编程基准测试争议说明什么

OpenAI 宣布停止使用 SWE-Bench Verified 评估前沿模型,Anthropic 的 Mythos 成绩也被质疑存在作弊检测漏洞。这场争议正在重塑 AI 编程能力评估的方式。

WayToClawEarn Editorial发布 2026年4月26日更新 2026年8月8日

编辑基于公开来源复核 · AI 辅助整理。 内容方法 · 原始来源

核心结论

2026年4月25-26日,AI 编程领域爆发了一场关于基准测试信任度的重大争议。OpenAI 官方宣布停止使用 SWE-Bench Verified 评估前沿模型,理由是该测试已被"学穿"(memorization),不再能区分真实编程能力与训练数据记忆。与此同时,Anthropic 新模型 Claude Mythos 在 SWE-Bench 上的突破性成绩也遭到质疑——有研究者指出其作弊检测论证存在致命逻辑错误。

这场争议的核心启示:评估 AI 编程能力不能依赖单一基准测试,用户和开发者需要依靠实际工作流中的真实表现来判断模型能力。

关键要点

  • 事件发生时间:2026年4月25-26日
  • 影响对象:AI 编程工具用户、Agent 自动化开发者、内容生产团队
  • 核心变化:SWE-Bench 从行业标准变为被质疑的基准,评估范式正在转变

背景与触发事件

OpenAI 宣布停用 SWE-Bench

4月25日,OpenAI 发布博客文章《Why SWE-Bench Verified no longer measures frontier coding capabilities》,正式宣布不再将 SWE-Bench Verified 作为前沿模型的评估标准。OpenAI 指出,随着大量模型训练数据中包含 SWE-Bench 的题目和解答,模型可能通过记忆而非真正的推理能力"通过"测试。

这并非没有先例——早在 2024-2025 年间,多个通用 NLP 基准(如 MMLU、GSM8K)就因类似原因被逐渐弃用。SWE-Bench 作为编程领域的黄金标准,如今也站到了同样的十字路口。

Anthropic Mythos 成绩存疑

几乎同时,Anthropic 的 Mythos 系统卡(System Card)晒出了惊艳的 SWE-Bench 成绩——在部分子集上高达 92% 的通过率,远超 Claude Opus 4.6 的 82%。为了消除作弊嫌疑,Anthropic 使用 LLM 检测器评估每个解法被"记忆"的概率,并声称结果"对阈值选择稳健"。

但独立研究员在 Philosophical Hacker 博客上发表了一篇分析,指出 Anthropic 的论证存在致命错误:一个不完美的作弊检测器可以"一致地"错误判断一个靠作弊取得成绩的模型为"真实能力"。他们用 Python 模拟证明了这一点——即使 Mythos 的成绩完全来自记忆,只要作弊检测器不完美,就能得出"成绩可靠"的假象。

SEO:SWE-Bench Verified 停用、AI 编程基准测试争议、模型评估信任危机 GEO:精确日期和数字(530 分、92% vs 82%、4月25日),TL;DR 式开头

关键影响(按维度)

维度变化对我们意味着什么建议动作
评估标准SWE-Bench 不再是可信基准厂商刷榜失去参考价值关注实际用例(如 Codex、Claude Code、Cline)的实测表现
模型选择基准分数无法对比不同模型依赖单一基准选模型会误判建立自己的测试工具体系(内部 benchmark)
行业趋势学穿问题从 NLP 延申到编程领域基准测试创新成为刚需关注动态基准(如 SWE-Bench Pro)和人工评估
信任成本用户需要更多独立验证厂商自报分数信任度下降优先选择有公开第三方评估的工具

适配建议

对 AI 编程用户

  • 不要仅凭 SWE-Bench 分数选择编码助手。实测 5 个你日常会遇到的编程任务,看哪个模型表现最稳定
  • 不同模型的长处不同:Claude 擅长重构和架构,OpenAI 模型擅长 Debug,DeepSeek 在国内场景表现优异。选模型要看场景

对 AI Agent 开发者

  • 建立自己的评估 pipeline,用真实仓库的分支(branch)做回归测试
  • 关注 #1 编程基准之外的能力:代码审查、需求理解、Bug 定位等
  • 可将多个模型的 API 同时接入 Agent 框架,做 A/B 测试

对自动化内容生产线

  • 用 AI 写代码的同时,必须保留人工代码审查环节
  • 代码质量评估应该看实际运行效果,而非"看起来对"
  • 结合 n8n / OpenClaw / Claude Code 等工具做端到端测试

AI 编程评估演变

延伸阅读:基准测试的演化史

SWE-Bench 并不是第一个被学穿的基准,也不会是最后一个:

  1. 2024 — MMLU 被指存在题目污染问题,部分模型通过训练数据记忆得分
  2. 2025 — GSM8K 数学推理基准遭遇类似质疑
  3. 2026.04 — SWE-Bench Verified 被 OpenAI 公开放弃
  4. 下一站 — 业界正在转向动态生成测试(如 FileIO 的 swe-gym、OpenAI 的 coding agents eval)

工具词条

本文中自然出现的工具:OpenAIClaudeClaude CodeDeepSeekn8nOpenClawChatGPTLangGraph

参考来源

内链引导

查看原文 →

免责声明:本站案例均为知识分享内容,仅供灵感与参考,不构成收益承诺;由此进行的外部执行与结果请自行判断并承担相应责任。