Dirac 开源 AI 编程代理在 TerminalBench 登顶:API 成本直降 65%,精度 100%
开源 AI 编程代理 Dirac 在 Terminal-Bench-2 以 65.2% 得分登顶,使用 Gemini-3-flash-preview 模型,API 成本比同类工具低 64.8%。前 Meta 工程师打造的创新 Agent 正在重新定义 AI 编程的经济学。
核心结论
2026 年 4 月 27 日,开源 AI 编程代理 Dirac 在 Terminal-Bench-2 排行榜上以 65.2% 的得分登顶,使用 Gemini-3-flash-preview 模型一举超越 Google 官方基线(47.6%)和顶级闭源 Agent Junie CLI(64.3%)。更令人瞩目的是,Dirac 在 8 项复杂重构任务中平均 API 成本仅 $0.18,比同类工具低 64.8%,同时在所有任务上保持 100% 的代码正确率。
关键要点
- 事件时间:2026 年 4 月 27 日(HN 首页热度 327 分)
- 项目地址:github.com/dirac-run/dirac(开源,TypeScript)
- 创作团队:SignalBloom AI,创始人 Max Trivedi(前 Meta 基础设施工程师)
- 核心亮点:用 Gemini-3-flash-preview 超越所有同类工具,API 成本仅为竞品三分之一
- 技术突破:Hash Anchored 编辑 + AST 原生操作 + 多文件批量处理
背景:AI 编程代理的成本困局
随着 Claude Code、Cursor、Cline、OpenCode 等 AI 编程代理(Coding Agent)的普及,开发者面临一个现实问题:Agent 越强大,API 调用成本越高。
一个月前(2026 年 3 月),我们有文章报道了 Hash Anchored 技术如何将 AI 代码编辑成本直降 60%。而现在,Dirac 将这一技术推向极致——不仅是成本控制,更在基准测试中击败了几乎所有同类工具。
Terminal-Bench-2 是目前最具挑战性的 AI 编程基准之一,专注于评估 Agent 在复杂、多文件、真实代码仓库上的重构能力。与 SWE-bench 的"修 bug"模式不同,TerminalBench 考察的是 Agent 进行大规模、跨文件代码变更的实际工程能力。
Dirac 的技术创新:从根源上降低 token 消耗
Dirac 团队的核心洞察是:模型的推理能力会随着上下文长度增加而显著退化。如果能精心管理上下文,就能同时提升准确率、降低成本、并处理更大规模的任务。
| 技术 | 原理 | 对成本/精度的影响 |
|---|---|---|
| Hash Anchored 编辑 | 用文件内容的稳定哈希值定位编辑位置,替代传统的行号定位 | 消除"行号漂移"导致的重复请求,精度 100% |
| AST 原生操作 | 内置编程语言语法理解,支持结构化重构 | 复杂变更无需多次迭代,1 次完成 |
| 多文件批量处理 | 单次 LLM 往返中处理数十个文件的编辑 | 减少 50-80% 的 API 往返次数 |
| 智能上下文筛选 | 只读取 LLM 真正需要的代码段,跳过无关部分 | 上下文缩短 60%,推理质量提升 |
| 无 MCP 设计 | 纯工具调用,不依赖 MCP 协议 | 减少协议开销,降低延迟 |
实测成本对比:每任务平均 API 费用
| 代理工具 | 平均成本/任务 | 与 Dirac 的差距 |
|---|---|---|
| Dirac | $0.18 | — |
| Cline | $0.49 | 高 2.7 倍 |
| Roo | $0.65 | 高 3.6 倍 |
| OpenCode | $0.44 | 高 2.4 倍 |
| Kilo | $0.64 | 高 3.5 倍 |
| OhMyPi | $0.48 | 高 2.7 倍 |
| Pimono | $0.40 | 高 2.2 倍 |
数据来源:Dirac 官方 README 的 8 项真实仓库重构任务评测(使用 Gemini-3-flash-preview,thinking 模式设为 high)
对 AI 自动化工作流的影响
Dirac 的出现对内容生产者和 AI 自动化从业者有三个直接启示:
1. API 成本不再是 Agent 的瓶颈
过去,"让 AI Agent 自动改代码"是个奢侈的选择——一次大规模重构可能烧掉 $0.5-$1.5 的 API 费用。Dirac 将平均成本压到 $0.18,让自动化代码修改变得和自动化内容发布一样经济实惠。
2. Gemini-3-flash-preview 验证了"低成本模型+高效率框架"路径
Dirac 用的是 Gemini-3-flash-preview——Google 的快速推理模型,而非昂贵的旗舰模型(如 GPT-5、Claude Opus)。这说明:Agent 的效率不在于用多大的模型,而在于如何管理模型的上下文和工具调用。这对本站在 n8n 和 Claude Code 教程中强调的"选择合适工具"理念是极佳的佐证。
3. 开源 Agent 生态加速成熟
Dirac 在上线仅 3 周内就获得了 725 个 GitHub Stars、187 次提交,并登上 HN 首页。作为完全开源的项目(TypeScript),它的架构方法可以被任何开发者借鉴和复现。这与我们之前在 AI Agent 工具教程中提到的"开源将重塑 AI 工具生态"的判断高度一致。
适配建议
- 如果你是 AI 自动化工作流用户:将 Dirac 作为 Claude Code 的低成本替代方案纳入评估,尤其是对 API 预算敏感的自动化流水线
- 如果你是内容自动化团队:关注 Gemini-3-flash-preview + 高效 Agent 的组合,它们正在重新定义"AI 编程的经济学"
- 如果你是开发者:查看 Dirac 的 GitHub 仓库,了解 Hash Anchored 编辑和 AST 操作的具体实现——这些设计思路可以移植到任意 AI Agent 项目中
相关延伸资料
工具词条(触发工具悬浮卡)
Dirac 的架构核心依赖于几家基础模型与工具:Gemini(Google)、Claude Code(Anthropic)、OpenAI、n8n、DeepSeek。正文中已自然出现其名称。
内链引导
- 想学 AI Agent 工具的使用方法?看:AI Agent 工具实操教程:从安装到自动化工作流
- 真实案例:有人用 AI Agent 创造了 $9,000 月收入:Claude Code 48小时创业:一人+29美元月费,3个月做到月入$9,000
- 零基础也能用 AI Agent 创业:18岁零基础用AI Agent造出月入$5,000的SaaS
- 搭配教程:如何用 Claude Code 实现自动化内容生产:如何用 Claude Code 实现自动化内容生产
主题中心
AI Agent 教程与工作流指南
比新闻更常青:按步骤搭建编程 Agent、内容流水线与 n8n 自动化,并链接到真实赚钱案例。
进入「AI Agent 教程与工作流指南」 →赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →