WayToClawEarn
高影响LangChain Blog

LangChain 开源模型路由器:Agent 编程中位成本降 64%,质量不降,怎么搭?

LangChain 在 Open SWE 编程 Agent 中内置模型路由器,973 线程 A/B 测试显示中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率 29.2% vs 27.3%(p=0.49,无统计差异)。路由器在 harness 中间件层实现,用 Jev 决策模型分类,将任务分为 Fast(GLM-5.3-Flash)、Balanced(GPT-5.6 Sol)、Performance(GPT-6 Astra)三档,代码已开源。

Edisen Lu · WayToClawEarn来源 LangChain Blog发布 2026年10月3日

基于公开来源复核 · AI 辅助整理,编辑把关。 内容方法 · 原始来源

公开来源汇编

综合公开帖文/文档整理。一手主张请优先核对原始来源。

我们如何审核内容 · 一手来源 · LangChain Blog

核心结论

LangChain 在其开源编程 Agent「Open SWE」中内置了模型路由器,973 线程的 A/B 测试结果:中位成本从 $2.61 降至 $0.94(降幅 64%),PR 合并率 29.2% 对比对照组 27.3%(p=0.49,无统计显著差异)。质量没降,成本砍了近三分之二。

为什么路由器要建在 Harness 里

LangChain 的核心观点是:模型路由器应该建在 Agent harness 中间件层,而不是独立的 API 网关。原因是 harness 拥有网关不具备的上下文信息——Agent 的提示词、工具集、领域知识。路由器在线程启动时读取第一条人类消息,选择一个模型用于整个线程。

这个设计决策来自对自身数据的分析。LangChain 从 LangSmith 追踪中提取了一周的 Open SWE 交互线程数据,用 LLM 分类器标注任务类型。分布如下:

  • 新功能开发:22%,线程更长、成本更高、轮次更多
  • Bug 修复:17%
  • 测试/空操作:16%,短且便宜
  • 其他:45%

这揭示了关键洞察:大部分任务不需要前沿模型的智能。如果你对所有任务都用最贵的模型,就是在为简单任务付溢价。

三档模型选择

LangChain 使用 Artificial Analysis Intelligence Index 绘制了智能-成本帕累托前沿,选了三个模型:

档位模型角色中位成本/线程
FastGLM-5.3-Flash (xhigh)开源模型,帕累托前沿$0.097
BalancedGPT-5.6 Sol (medium)中档成本/速度/智能$1.50
PerformanceGPT-6 Astra (low)最强最贵$2.88

Fast 和 Performance 之间有约 30 倍的成本差距。路由后的线程分布:Balanced 56%,Fast 34%,Performance 10%。

这意味着:超过三分之一的任务被路由到了 Fast 档($0.097/线程),只有 10% 的任务真正需要最贵的模型。

路由器怎么工作

路由器由三部分组成:

  1. 基础提示词:指示分类器选择最便宜的可能完成任务的模型
  2. 每档标准:用自然语言描述每档应该处理什么工作,来源是任务分析(步骤 1)和各模型的提供商文档
  3. 分类器模型:读取请求并选择档位

第一版用 LLM 结构化输出做分类;当前版本运行在 Jev 上——TypeSafe 的决策模型,使分类速度提升约 50 倍。

这和最近决策模型的趋势一脉相承:TypeSafe Jev(9 月 25 日)→ OpenAI Jev 克隆 → AWS Strands Decider 2B → Cloudflare Clef。LangChain 的实践证明,决策模型不是玩具——它在一个生产级编程 Agent 中承担了每天数千次的路由决策。

A/B 测试硬数据

测试 1:路由器 vs 始终用 Performance(GPT-6 Astra)

指标路由组对照组(GPT-6 Astra)p 值
总线程数~487(973 的一半)~486—
PR 合并率29.2%27.3%0.49
PR 打开率38.9%39.6%0.82
中位成本/线程$0.94$2.61—
平均成本降幅——42%
p90 成本降幅——37%
中位成本降幅——64%

关键发现:PR 合并率在路由组甚至略高(尽管不显著,p=0.49)。成本降低不是由少数便宜异常值驱动的——平均降 42%,p90 降 37%,说明节省是系统性的。

测试 2:路由器 vs 始终用 Fast(GLM-5.3-Flash)

一天内就终止了。工程师几乎立刻发现问题:Fast-only 档的输出质量严重不足,干扰了生产力。这证明路由器的价值在于分级——不是简单选最便宜的,而是让该贵的任务用贵的模型。

工程师的反馈

用户反馈直接揭示了路由失误的成本:

"pretty expensive for this query"(这个查询太贵了)

"this request should not have been routed to the performance model."(这个请求不应该路由到 Performance 档)

这些反馈来自 Open SWE 中新增的 thumbs up/down 功能,记录在 LangSmith 追踪上。虽然信号较稀疏,但能捕捉到路由错误。

开源实现

路由器实现完全开源,代码位于:

  • Open SWE 仓库:github.com/langchain-ai/open-swe
  • 路由中间件:agent/middleware/model_selection.py
  • 模型路由中间件文档:docs.langchain.com 的 typesafe 集成页

LangChain 还发布了一个通用的模型路由中间件,接受你的基础提示词、模型档位和档位标准。这意味着你可以将自己的 Agent 接入这套路由系统。

对开发者的实际影响

  1. 大部分 Agent 任务不需要最贵的模型。如果你的 Agent 对所有调用都用 GPT-6 Astra 或 Claude Opus,你可能在为 34% 的简单任务付 30 倍溢价。
  2. 路由器属于 harness,不属于网关。通用 API 网关缺乏任务上下文,无法做出和 harness 一样好的路由决策。
  3. 决策模型正在成为 Agent 架构的标准组件。Jev 做分类 50 倍快于 LLM 结构化输出,Strands Decider 和 Clef 做工具调用前的 gating——这些都是同一个趋势的不同切面。
  4. 成本优化的第一杠杆不是换更便宜的模型,而是让简单任务自动流向便宜模型。64% 的降幅证明了这一点。

四步搭建你自己的路由器

LangChain 给出了可复现的流程:

  1. 理解你的任务:从追踪数据中挖掘任务类型分布
  2. 理解你的模型:在智能-成本曲线上选模型
  3. 在 harness 中建路由器:把路由当作上下文工程
  4. 追踪任务结果:在路由之前设置评估、在线评估器或用户反馈

未来方向

LangChain 计线的下一步:

  • 在 DeepSWE 等编码基准上做受控评估
  • 子 Agent 的模型选择(目前子 Agent 独立于路由器选模型)
  • 线程中途重新路由(代价:提示词缓存失效)
  • 挖掘用户情绪数据来识别路由错误

来源与验证

  • 一手来源:LangChain 官方博客(langchain.com/blog/how-to-build-a-model-router-in-the-harness)
  • 开源代码:github.com/langchain-ai/open-swe
  • 模型路由中间件文档:docs.langchain.com
  • Jev 决策模型:typesafe.ai
  • Artificial Analysis Intelligence Index:artificialanalysis.ai
  • A/B 测试数据来自 LangSmith 追踪,973 线程,一周数据
  • 所有成本数据以美元计价,来自 LangChain 官方披露
LangChainmodel routeragent cost optimizationOpen SWEJevdecision modelA/B testingopen source

查看原文 →

仅供学习参考:案例基于公开来源整理,并可能经 AI 辅助起草、由编辑复核。不构成投资或收益建议,亦不保证结果。