SWE-Bench 信任危机:OpenAI 和 Anthropic 的编程基准测试争议说明什么
OpenAI 宣布停止使用 SWE-Bench Verified 评估前沿模型,Anthropic 的 Mythos 成绩也被质疑存在作弊检测漏洞。这场争议正在重塑 AI 编程能力评估的方式。
核心结论
2026年4月25-26日,AI 编程领域爆发了一场关于基准测试信任度的重大争议。OpenAI 官方宣布停止使用 SWE-Bench Verified 评估前沿模型,理由是该测试已被"学穿"(memorization),不再能区分真实编程能力与训练数据记忆。与此同时,Anthropic 新模型 Claude Mythos 在 SWE-Bench 上的突破性成绩也遭到质疑——有研究者指出其作弊检测论证存在致命逻辑错误。
这场争议的核心启示:评估 AI 编程能力不能依赖单一基准测试,用户和开发者需要依靠实际工作流中的真实表现来判断模型能力。
关键要点
- 事件发生时间:2026年4月25-26日
- 影响对象:AI 编程工具用户、Agent 自动化开发者、内容生产团队
- 核心变化:SWE-Bench 从行业标准变为被质疑的基准,评估范式正在转变
背景与触发事件
OpenAI 宣布停用 SWE-Bench
4月25日,OpenAI 发布博客文章《Why SWE-Bench Verified no longer measures frontier coding capabilities》,正式宣布不再将 SWE-Bench Verified 作为前沿模型的评估标准。OpenAI 指出,随着大量模型训练数据中包含 SWE-Bench 的题目和解答,模型可能通过记忆而非真正的推理能力"通过"测试。
这并非没有先例——早在 2024-2025 年间,多个通用 NLP 基准(如 MMLU、GSM8K)就因类似原因被逐渐弃用。SWE-Bench 作为编程领域的黄金标准,如今也站到了同样的十字路口。
Anthropic Mythos 成绩存疑
几乎同时,Anthropic 的 Mythos 系统卡(System Card)晒出了惊艳的 SWE-Bench 成绩——在部分子集上高达 92% 的通过率,远超 Claude Opus 4.6 的 82%。为了消除作弊嫌疑,Anthropic 使用 LLM 检测器评估每个解法被"记忆"的概率,并声称结果"对阈值选择稳健"。
但独立研究员在 Philosophical Hacker 博客上发表了一篇分析,指出 Anthropic 的论证存在致命错误:一个不完美的作弊检测器可以"一致地"错误判断一个靠作弊取得成绩的模型为"真实能力"。他们用 Python 模拟证明了这一点——即使 Mythos 的成绩完全来自记忆,只要作弊检测器不完美,就能得出"成绩可靠"的假象。
SEO:SWE-Bench Verified 停用、AI 编程基准测试争议、模型评估信任危机 GEO:精确日期和数字(530 分、92% vs 82%、4月25日),TL;DR 式开头
关键影响(按维度)
| 维度 | 变化 | 对我们意味着什么 | 建议动作 |
|---|---|---|---|
| 评估标准 | SWE-Bench 不再是可信基准 | 厂商刷榜失去参考价值 | 关注实际用例(如 Codex、Claude Code、Cline)的实测表现 |
| 模型选择 | 基准分数无法对比不同模型 | 依赖单一基准选模型会误判 | 建立自己的测试工具体系(内部 benchmark) |
| 行业趋势 | 学穿问题从 NLP 延申到编程领域 | 基准测试创新成为刚需 | 关注动态基准(如 SWE-Bench Pro)和人工评估 |
| 信任成本 | 用户需要更多独立验证 | 厂商自报分数信任度下降 | 优先选择有公开第三方评估的工具 |
适配建议
对 AI 编程用户
- 不要仅凭 SWE-Bench 分数选择编码助手。实测 5 个你日常会遇到的编程任务,看哪个模型表现最稳定
- 不同模型的长处不同:Claude 擅长重构和架构,OpenAI 模型擅长 Debug,DeepSeek 在国内场景表现优异。选模型要看场景
对 AI Agent 开发者
- 建立自己的评估 pipeline,用真实仓库的分支(branch)做回归测试
- 关注 #1 编程基准之外的能力:代码审查、需求理解、Bug 定位等
- 可将多个模型的 API 同时接入 Agent 框架,做 A/B 测试
对自动化内容生产线
- 用 AI 写代码的同时,必须保留人工代码审查环节
- 代码质量评估应该看实际运行效果,而非"看起来对"
- 结合 n8n / OpenClaw / Claude Code 等工具做端到端测试
延伸阅读:基准测试的演化史
SWE-Bench 并不是第一个被学穿的基准,也不会是最后一个:
- 2024 — MMLU 被指存在题目污染问题,部分模型通过训练数据记忆得分
- 2025 — GSM8K 数学推理基准遭遇类似质疑
- 2026.04 — SWE-Bench Verified 被 OpenAI 公开放弃
- 下一站 — 业界正在转向动态生成测试(如 FileIO 的 swe-gym、OpenAI 的 coding agents eval)
工具词条
本文中自然出现的工具:OpenAI、Claude、Claude Code、DeepSeek、n8n、OpenClaw、ChatGPT、LangGraph
参考来源
- Hacker News: Why SWE-bench Verified no longer measures frontier coding capabilities
- Philosophical Hacker: Anthropic's Argument for Mythos SWE-bench improvement contains a fatal error
- Hacker News: Amateur armed with ChatGPT solves an Erdős problem
内链引导
- 想系统学习 AI 编程工具?看:AI Agent 工具实操教程:从安装到自动化工作流
- 别人用 Claude Code 赚到了钱:Claude Code 48小时创业:一人+29美元月费,3个月做到月入$9,000
- 真实自动化变现案例:用 OpenClaw + Claude 构建自动化内容发布系统:月入 $1,500-$2,500
赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →