WayToClawEarn
高影响Hacker News / GitHub

Dirac 开源 AI 编程代理在 TerminalBench 登顶:API 成本直降 65%,精度 100%

开源 AI 编程代理 Dirac 在 Terminal-Bench-2 以 65.2% 得分登顶,使用 Gemini-3-flash-preview 模型,API 成本比同类工具低 64.8%。前 Meta 工程师打造的创新 Agent 正在重新定义 AI 编程的经济学。

WayToClawEarn Editorial发布 2026年4月28日更新 2026年8月8日

编辑基于公开来源复核 · AI 辅助整理。 内容方法 · 原始来源

核心结论

2026 年 4 月 27 日,开源 AI 编程代理 Dirac 在 Terminal-Bench-2 排行榜上以 65.2% 的得分登顶,使用 Gemini-3-flash-preview 模型一举超越 Google 官方基线(47.6%)和顶级闭源 Agent Junie CLI(64.3%)。更令人瞩目的是,Dirac 在 8 项复杂重构任务中平均 API 成本仅 $0.18,比同类工具低 64.8%,同时在所有任务上保持 100% 的代码正确率。

关键要点

  • 事件时间:2026 年 4 月 27 日(HN 首页热度 327 分)
  • 项目地址:github.com/dirac-run/dirac(开源,TypeScript)
  • 创作团队:SignalBloom AI,创始人 Max Trivedi(前 Meta 基础设施工程师)
  • 核心亮点:用 Gemini-3-flash-preview 超越所有同类工具,API 成本仅为竞品三分之一
  • 技术突破:Hash Anchored 编辑 + AST 原生操作 + 多文件批量处理

背景:AI 编程代理的成本困局

随着 Claude Code、Cursor、Cline、OpenCode 等 AI 编程代理(Coding Agent)的普及,开发者面临一个现实问题:Agent 越强大,API 调用成本越高

一个月前(2026 年 3 月),我们有文章报道了 Hash Anchored 技术如何将 AI 代码编辑成本直降 60%。而现在,Dirac 将这一技术推向极致——不仅是成本控制,更在基准测试中击败了几乎所有同类工具。

Terminal-Bench-2 是目前最具挑战性的 AI 编程基准之一,专注于评估 Agent 在复杂、多文件、真实代码仓库上的重构能力。与 SWE-bench 的"修 bug"模式不同,TerminalBench 考察的是 Agent 进行大规模、跨文件代码变更的实际工程能力。

Dirac 的技术创新:从根源上降低 token 消耗

Dirac 团队的核心洞察是:模型的推理能力会随着上下文长度增加而显著退化。如果能精心管理上下文,就能同时提升准确率、降低成本、并处理更大规模的任务。

技术原理对成本/精度的影响
Hash Anchored 编辑用文件内容的稳定哈希值定位编辑位置,替代传统的行号定位消除"行号漂移"导致的重复请求,精度 100%
AST 原生操作内置编程语言语法理解,支持结构化重构复杂变更无需多次迭代,1 次完成
多文件批量处理单次 LLM 往返中处理数十个文件的编辑减少 50-80% 的 API 往返次数
智能上下文筛选只读取 LLM 真正需要的代码段,跳过无关部分上下文缩短 60%,推理质量提升
无 MCP 设计纯工具调用,不依赖 MCP 协议减少协议开销,降低延迟

实测成本对比:每任务平均 API 费用

代理工具平均成本/任务与 Dirac 的差距
Dirac$0.18
Cline$0.49高 2.7 倍
Roo$0.65高 3.6 倍
OpenCode$0.44高 2.4 倍
Kilo$0.64高 3.5 倍
OhMyPi$0.48高 2.7 倍
Pimono$0.40高 2.2 倍

数据来源:Dirac 官方 README 的 8 项真实仓库重构任务评测(使用 Gemini-3-flash-preview,thinking 模式设为 high)

对 AI 自动化工作流的影响

Dirac 的出现对内容生产者和 AI 自动化从业者有三个直接启示:

1. API 成本不再是 Agent 的瓶颈

过去,"让 AI Agent 自动改代码"是个奢侈的选择——一次大规模重构可能烧掉 $0.5-$1.5 的 API 费用。Dirac 将平均成本压到 $0.18,让自动化代码修改变得和自动化内容发布一样经济实惠。

2. Gemini-3-flash-preview 验证了"低成本模型+高效率框架"路径

Dirac 用的是 Gemini-3-flash-preview——Google 的快速推理模型,而非昂贵的旗舰模型(如 GPT-5、Claude Opus)。这说明:Agent 的效率不在于用多大的模型,而在于如何管理模型的上下文和工具调用。这对本站在 n8n 和 Claude Code 教程中强调的"选择合适工具"理念是极佳的佐证。

3. 开源 Agent 生态加速成熟

Dirac 在上线仅 3 周内就获得了 725 个 GitHub Stars、187 次提交,并登上 HN 首页。作为完全开源的项目(TypeScript),它的架构方法可以被任何开发者借鉴和复现。这与我们之前在 AI Agent 工具教程中提到的"开源将重塑 AI 工具生态"的判断高度一致。

适配建议

  • 如果你是 AI 自动化工作流用户:将 Dirac 作为 Claude Code 的低成本替代方案纳入评估,尤其是对 API 预算敏感的自动化流水线
  • 如果你是内容自动化团队:关注 Gemini-3-flash-preview + 高效 Agent 的组合,它们正在重新定义"AI 编程的经济学"
  • 如果你是开发者:查看 Dirac 的 GitHub 仓库,了解 Hash Anchored 编辑和 AST 操作的具体实现——这些设计思路可以移植到任意 AI Agent 项目中

Dirac 成本对比图

相关延伸资料

工具词条(触发工具悬浮卡)

Dirac 的架构核心依赖于几家基础模型与工具:Gemini(Google)、Claude Code(Anthropic)、OpenAIn8nDeepSeek。正文中已自然出现其名称。

内链引导

查看原文 →

免责声明:本站案例均为知识分享内容,仅供灵感与参考,不构成收益承诺;由此进行的外部执行与结果请自行判断并承担相应责任。