WayToClawEarn
高影响OpenAI 官方博客

OpenAI 宣布 SWE-bench Verified 已饱和:前沿编程测试不再有效,推荐 SWE-bench Pro

OpenAI 发布最新分析报告指出,SWE-bench Verified 基准测试已因数据污染和测试用例缺陷不再适合衡量前沿模型的编程能力。测试显示 59.4% 的难题存在缺陷,所有前沿模型均能复现标准答案,建议行业转向 SWE-bench Pro。

WayToClawEarn Editorial发布 2026年4月27日更新 2026年8月8日

编辑基于公开来源复核 · AI 辅助整理。 内容方法 · 原始来源

核心结论

2026 年 4 月 27 日,OpenAI 发布重磅分析报告,正式宣布 SWE-bench Verified 基准测试已不再适合衡量前沿 AI 模型的编码能力。原因是该基准存在两大核心问题:59.4% 的高难度题目测试用例存在缺陷,以及所有前沿模型均已受到训练数据污染

关键要点

  • 事件发生时间:2026-04-27
  • 影响对象:所有使用 SWE-bench Verified 评估模型编码能力的团队
  • 核心变化:OpenAI 已停止报告该指标,建议全行业转向 SWE-bench Pro
  • Claude Opus 4.5 以 93.9% 成为该基准的"终结者"

背景与触发事件

OpenAI 在 2024 年 8 月推出 SWE-bench Verified,作为原始 SWE-bench 的改进版本,旨在解决测试过于严格、任务描述不明确等问题。过去 6 个月间,该指标从 74.9% 提升至 80.9%,增速明显放缓。

真正的问题是:剩余失败是模型能力不足,还是数据集本身的问题?为此,OpenAI 组织了一次大规模审计——由至少 6 名资深工程师独立审查了 138 道高难度题目,结果触目惊心。

对于 AI 赚钱和自动化从业者来说,这意味着:不要依赖单一基准衡量 AI 编程工具的真实能力,实际项目中的复杂场景才是真正的测试场。

关键问题分析

问题维度具体发现对 AI 自动化从业者的影响建议动作
测试缺陷59.4% 的难题存在 "过窄" 或 "过宽" 的测试用例,正确代码被误判为失败工具评测结果的参考价值下降在自动化流水线中增加多模型交叉验证
数据污染所有前沿模型(GPT-5.2、Claude Opus 4.5、Gemini 3)都能复现标准答案原文基准分数不能反映实际能力差距关注实际项目交付质量而非排行榜
基准饱和Claude Opus 4.5 达到 93.9%,SWE-bench 联合创始人确认真实饱和旧基准不再提供区分度转向 SWE-bench Pro 等新评估体系
新基准SWE-bench Multilingual、Multimodal 即将开源,CodeClash、AlgoTune 已可用测试标准正在快速升级提前适配多语言、多模态的评估方式

适配建议

对于正在构建 AI 自动化工作流的团队和独立开发者:

  • 不要用 SWE-bench Verified 分数作为选择 AI 编码工具的唯一依据。Claude 在该基准上领先,但在实际复杂项目中需要结合场景测试。
  • 在自动化流水线中引入实际场景测试:用你自己项目的 issue 和 PR 作为测试集,比任何公开基准都更可靠。
  • 关注 OpenAI 推荐的 SWE-bench Pro,它使用了更严格的去污染机制,目前尚未饱和。
  • 如果你在搭建 AI Agent 自动化内容生产系统(如使用 OpenClaw 或 Claude Code),建议用多个模型交叉验证代码输出,而不是依赖单一模型的基准分数。

任务清单

  • 将 AI 编码工具的评估从 "看排行榜" 转向 "跑自己的真实项目用例"
  • 在自动化流水线中加入多模型 A/B 测试对比
  • 关注 SWE-bench Multilingual/Multimodal 开源动态,提前规划适配
  • 对现有依赖 AI 编码的工作流进行去污染风险审查

AI 编程工具对比

相关延伸资料

工具词条(触发工具悬浮卡)

正文中提到:OpenAIClaude(Anthropic)、Gemini(Google)、GPT-5.2Claude Opus 4.5OpenClawClaude Coden8n

内链引导

查看原文 →

免责声明:本站案例均为知识分享内容,仅供灵感与参考,不构成收益承诺;由此进行的外部执行与结果请自行判断并承担相应责任。