LangChain 开源模型路由器:Agent 编程中位成本降 64%,质量不降,怎么搭?
LangChain 在 Open SWE 编程 Agent 中内置模型路由器,973 线程 A/B 测试显示中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率 29.2% vs 27.3%(p=0.49,无统计差异)。路由器在 harness 中间件层实现,用 Jev 决策模型分类,将任务分为 Fast(GLM-5.3-Flash)、Balanced(GPT-5.6 Sol)、Performance(GPT-6 Astra)三档,代码已开源。
核心结论
LangChain 在其开源编程 Agent「Open SWE」中内置了模型路由器,973 线程的 A/B 测试结果:中位成本从 $2.61 降至 $0.94(降幅 64%),PR 合并率 29.2% 对比对照组 27.3%(p=0.49,无统计显著差异)。质量没降,成本砍了近三分之二。
为什么路由器要建在 Harness 里
LangChain 的核心观点是:模型路由器应该建在 Agent harness 中间件层,而不是独立的 API 网关。原因是 harness 拥有网关不具备的上下文信息——Agent 的提示词、工具集、领域知识。路由器在线程启动时读取第一条人类消息,选择一个模型用于整个线程。
这个设计决策来自对自身数据的分析。LangChain 从 LangSmith 追踪中提取了一周的 Open SWE 交互线程数据,用 LLM 分类器标注任务类型。分布如下:
- 新功能开发:22%,线程更长、成本更高、轮次更多
- Bug 修复:17%
- 测试/空操作:16%,短且便宜
- 其他:45%
这揭示了关键洞察:大部分任务不需要前沿模型的智能。如果你对所有任务都用最贵的模型,就是在为简单任务付溢价。
三档模型选择
LangChain 使用 Artificial Analysis Intelligence Index 绘制了智能-成本帕累托前沿,选了三个模型:
| 档位 | 模型 | 角色 | 中位成本/线程 |
|---|---|---|---|
| Fast | GLM-5.3-Flash (xhigh) | 开源模型,帕累托前沿 | $0.097 |
| Balanced | GPT-5.6 Sol (medium) | 中档成本/速度/智能 | $1.50 |
| Performance | GPT-6 Astra (low) | 最强最贵 | $2.88 |
Fast 和 Performance 之间有约 30 倍的成本差距。路由后的线程分布:Balanced 56%,Fast 34%,Performance 10%。
这意味着:超过三分之一的任务被路由到了 Fast 档($0.097/线程),只有 10% 的任务真正需要最贵的模型。
路由器怎么工作
路由器由三部分组成:
- 基础提示词:指示分类器选择最便宜的可能完成任务的模型
- 每档标准:用自然语言描述每档应该处理什么工作,来源是任务分析(步骤 1)和各模型的提供商文档
- 分类器模型:读取请求并选择档位
第一版用 LLM 结构化输出做分类;当前版本运行在 Jev 上——TypeSafe 的决策模型,使分类速度提升约 50 倍。
这和最近决策模型的趋势一脉相承:TypeSafe Jev(9 月 25 日)→ OpenAI Jev 克隆 → AWS Strands Decider 2B → Cloudflare Clef。LangChain 的实践证明,决策模型不是玩具——它在一个生产级编程 Agent 中承担了每天数千次的路由决策。
A/B 测试硬数据
测试 1:路由器 vs 始终用 Performance(GPT-6 Astra)
| 指标 | 路由组 | 对照组(GPT-6 Astra) | p 值 |
|---|---|---|---|
| 总线程数 | ~487(973 的一半) | ~486 | — |
| PR 合并率 | 29.2% | 27.3% | 0.49 |
| PR 打开率 | 38.9% | 39.6% | 0.82 |
| 中位成本/线程 | $0.94 | $2.61 | — |
| 平均成本降幅 | — | — | 42% |
| p90 成本降幅 | — | — | 37% |
| 中位成本降幅 | — | — | 64% |
关键发现:PR 合并率在路由组甚至略高(尽管不显著,p=0.49)。成本降低不是由少数便宜异常值驱动的——平均降 42%,p90 降 37%,说明节省是系统性的。
测试 2:路由器 vs 始终用 Fast(GLM-5.3-Flash)
一天内就终止了。工程师几乎立刻发现问题:Fast-only 档的输出质量严重不足,干扰了生产力。这证明路由器的价值在于分级——不是简单选最便宜的,而是让该贵的任务用贵的模型。
工程师的反馈
用户反馈直接揭示了路由失误的成本:
"pretty expensive for this query"(这个查询太贵了)
"this request should not have been routed to the performance model."(这个请求不应该路由到 Performance 档)
这些反馈来自 Open SWE 中新增的 thumbs up/down 功能,记录在 LangSmith 追踪上。虽然信号较稀疏,但能捕捉到路由错误。
开源实现
路由器实现完全开源,代码位于:
- Open SWE 仓库:github.com/langchain-ai/open-swe
- 路由中间件:agent/middleware/model_selection.py
- 模型路由中间件文档:docs.langchain.com 的 typesafe 集成页
LangChain 还发布了一个通用的模型路由中间件,接受你的基础提示词、模型档位和档位标准。这意味着你可以将自己的 Agent 接入这套路由系统。
对开发者的实际影响
- 大部分 Agent 任务不需要最贵的模型。如果你的 Agent 对所有调用都用 GPT-6 Astra 或 Claude Opus,你可能在为 34% 的简单任务付 30 倍溢价。
- 路由器属于 harness,不属于网关。通用 API 网关缺乏任务上下文,无法做出和 harness 一样好的路由决策。
- 决策模型正在成为 Agent 架构的标准组件。Jev 做分类 50 倍快于 LLM 结构化输出,Strands Decider 和 Clef 做工具调用前的 gating——这些都是同一个趋势的不同切面。
- 成本优化的第一杠杆不是换更便宜的模型,而是让简单任务自动流向便宜模型。64% 的降幅证明了这一点。
四步搭建你自己的路由器
LangChain 给出了可复现的流程:
- 理解你的任务:从追踪数据中挖掘任务类型分布
- 理解你的模型:在智能-成本曲线上选模型
- 在 harness 中建路由器:把路由当作上下文工程
- 追踪任务结果:在路由之前设置评估、在线评估器或用户反馈
未来方向
LangChain 计线的下一步:
- 在 DeepSWE 等编码基准上做受控评估
- 子 Agent 的模型选择(目前子 Agent 独立于路由器选模型)
- 线程中途重新路由(代价:提示词缓存失效)
- 挖掘用户情绪数据来识别路由错误
来源与验证
- 一手来源:LangChain 官方博客(langchain.com/blog/how-to-build-a-model-router-in-the-harness)
- 开源代码:github.com/langchain-ai/open-swe
- 模型路由中间件文档:docs.langchain.com
- Jev 决策模型:typesafe.ai
- Artificial Analysis Intelligence Index:artificialanalysis.ai
- A/B 测试数据来自 LangSmith 追踪,973 线程,一周数据
- 所有成本数据以美元计价,来自 LangChain 官方披露
主题中心
AI Agent 教程与工作流指南
比新闻更常青:按步骤搭建编程 Agent、内容流水线与 n8n 自动化,并链接到真实赚钱案例。
进入「AI Agent 教程与工作流指南」 →赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →