WayToClawEarn
高影响Supabase Official Blog

Supabase 开源首个真实场景 AI 编程智能体评测:Claude Code 53.2% 领先,无工具超 60%

Supabase Evals 在真实后端任务上评测 AI 编程智能体。Claude Code 53.2% 领先,无工具超 60%,框架开源可复现。

WayToClawEarn Editorial发布 2026年8月3日

编辑基于公开来源复核 · AI 辅助整理。 内容方法

核心结论

Supabase 开源了一个 AI 编程智能体评测框架 Supabase Evals,在真实后端任务上测试 Claude Code、Codex 和 OpenCode。Claude Code 以 53.2% 的成功率领先,Codex 紧随其后。这对开发者的意义在于:这是目前最接近真实工作场景的 AI 编程工具评测,比传统基准测试更能反映智能体在生产环境中的实际表现。

事件

8 月 1 日,Supabase 以 Apache-2.0 协议在 GitHub 开源了 supabase/evals。这是一个可复现的基准测试框架,让 AI 编程智能体完成真实的 Supabase 开发任务——不是玩具问题,不是合成数据集,而是从真实用户工单和 GitHub Issue 中提取的场景。

被测试的智能体包括 Claude Code、OpenAI Codex 和 OpenCode。具体任务涵盖:从零构建数据库 schema、调试失败的 Edge Function、修复损坏的行级安全策略(RLS)、编写数据库迁移脚本、处理认证流程等。这些正是开发者付费使用 Supabase 要解决的实际问题。

框架通过 pnpm 在本地运行。每个智能体都能访问 Supabase 的 MCP 服务器和 CLI,和人类开发者使用完全相同的工具链。评测标准不是代码能否编译通过,而是任务是否正确完成。所有结果发布在 Web 仪表板上,任何人都可以查看和验证。

测试结果

Claude Code 成功完成了 53.2% 的场景——这是目前的最高分。Codex 紧随其后,差距不大。OpenCode 作为完全开源的替代方案,虽然稍显落后,但提供了完全透明的运行过程和决策链路。

53.2% 的通过率初看不高,但需要理解测试的上下文:这些不是孤立的代码补全提示。每个任务要求智能体理解有状态的环境、跨多个步骤做出决策、产出真正可运行的基础设施——而不仅仅是生成代码。人类开发者在这些任务上第一次也不会全对。

为什么这个评测框架与众不同

目前主流的 AI 编程评测——SWE-bench、LiveCodeBench、Terminal-Bench——测试的是模型在孤立代码任务上的表现。智能体收到提示、生成代码、由评判器打分。这些评测有参考价值,但遗漏了一个关键维度:真实开发发生在有状态的环境中,一个错误决策可能导致连锁反应。

Supabase Evals 测试的是完整闭环。智能体需要搭建项目、理解数据库当前状态、定位问题根源、做出修改、验证修复是否生效。这更接近开发者实际使用场景——比如周四晚上 10 点对 Claude Code 说「修一下认证中间件」,然后期望它自己搞清楚所有上下文。

框架的另一个关键特点是可复现性。任何人都可以克隆仓库、运行相同测试、得到相同结果。这很重要,因为供应商自己发布的评测存在明显的动机问题。一个独立、开源、任何人都能验证的评测框架,从根本上改变了评测的信任基础。

对开发者的实际意义

如果你在评估 AI 编程工具,现在多了一个与 SWE-bench 分数性质完全不同的数据点。以下是实操建议:

  1. 判断后端和基础设施任务对你的工作流有多重要。如果你主要写前端组件,Supabase Evals 结果对你的参考价值有限。如果你日常构建 API 和数据库 schema,这个评测的参考价值远高于通用代码评测。

  2. 不要过度关注精确数字。53.2% 和 Codex 分数之间的差异,远不如「没有任何智能体超过 60%」这个事实重要。核心结论是:这些工具在后端任务上有用,但仍需人类监督——而不是「Claude Code 绝对碾压竞品」。

  3. 如果你使用 Supabase,自己跑一遍评测。框架完全开源,你的具体技术栈和工作流对智能体的压力可能与默认场景不同。框架的设计初衷就是让你在自己的环境中验证。

  4. 关注平台特定评测的扩散趋势。Supabase 为自家平台构建了评测。如果 Vercel、AWS、Firebase 等平台效仿,我们将获得更丰富的全景图,了解 AI 编程智能体在不同基础设施上下文中的真实表现。

深层意义

这次发布是 AI 编程工具评估方式变革的一个缩影。半年前,整个行业的讨论由模型对比评测表主导,标题通常是「XX 模型在 SWE-bench 上超越 YY」。现在我们看到的是平台特定、任务特定的评估框架,衡量的是智能体实际能构建什么,而不是在模拟环境中的得分。

从商业策略角度看,Supabase 的举动也很精明。通过开源评测框架,他们创造了一个激励机制:AI 编程工具制造商需要优化 Supabase 兼容性。如果 Claude Code 想登顶排行榜,就需要更好地编写 Supabase Edge Functions 和 RLS 策略。这是一个伪装成公共服务的平台护城河。

顶级智能体之间的评测差距正在缩小。Claude Code 53.2% 与 Codex 紧随其后,说明前沿能力正在趋同。AI 编程的下一个竞争维度不是更好的模型——而是更好地评估这些模型在真实环境中实际能交付什么。

结论

Supabase Evals 为开发者提供了 AI 编程智能体在后端任务上的第一个真实世界评测基准。Claude Code 目前领先,但没有任何智能体超过 60%,框架完全开源。如果你的技术栈包含 Supabase,建议亲自跑一遍验证。如果不是,请关注类似平台特定评测的出现——它们代表了 AI 编程工具评估的下一个演进方向。在这之前,对任何声称「AI 编程能力已超越人类」的说法保持怀疑:行业最强智能体在真实后端任务上的成功率才刚刚过半。

supabaseclaudecodexcodingbenchmarkagent
免责声明:本站案例均为知识分享内容,仅供灵感与参考,不构成收益承诺;由此进行的外部执行与结果请自行判断并承担相应责任。
Supabase Evals 开源评测:Claude Code vs Codex 真实后端任务对比 · WayToClawEarn