WayToClawEarn
中等影响Strands Agents Blog

AWS 开源 Strands Decider 2B 决策模型:不生成文本只返回概率,AI Agent 路由怎么降本?

AWS Strands Labs 发布 Strands Decider 2B 开源决策模型,基于 Qwen3.5-2B 躯干去除 LM Head 并替换为指针打分头,在 JevBench 公开集达到 72.3% 准确率,本地 RTX 3090 中位延迟 115ms。该模型不生成自由文本,而是在预设选项间做选择并输出置信度分数,适合 Agent 工作流中的模型路由、工具门控、参数 grounding 检查等高频低复杂度决策,降低对前沿 LLM 的依赖和调用成本。

Edisen Lu · WayToClawEarn来源 Strands Agents Blog发布 2026年10月2日

基于公开来源复核 · AI 辅助整理,编辑把关。 内容方法 · 原始来源

公开来源汇编

综合公开帖文/文档整理。一手主张请优先核对原始来源。

我们如何审核内容 · 一手来源 · Strands Agents Blog

核心结论

AWS Strands Labs 于 2026 年 10 月 1 日发布 Strands Decider 2B 开源决策模型。该模型基于 Qwen3.5-2B 躯干构建,移除了语言模型头(LM Head),替换为一个约百万参数的指针打分头(Pointer Head),在 JevBench 公开测试集上达到 72.3% 准确率(167/231),本地 RTX 3090 中位延迟约 115ms。模型采用 Apache-2.0 协议完全开源,包含训练数据和脚本,可直接通过 pip install strands-decider 安装使用。

这标志着"决策模型"(Decision Model)这一新品类正在从 TypeSafe Jev 的首创走向行业普及。决策模型不生成自由文本,而是在预设选项间做选择并输出校准置信度分数,专为 AI Agent 工作流中的高频低复杂度决策设计——模型路由、工具选择、参数 grounding 检查、策略分类——以极低延迟和成本替代不必要的 LLM 调用。

什么是决策模型?为什么 Agent 开发者需要它?

在 AI Agent 工作流中,大量决策本质上是"在有限选项里选一个":用户说"打开灯",该调哪个工具?参数是否来自用户真实输入?现在调工具是否过早?这些问题用 GPT-6 或 Claude Opus 5.5 回答,既慢又贵,且无法提供可靠的置信度分数。

TypeSafe AI 在 2026 年 9 月中旬推出 Jev 模型后,"决策模型"(也叫 System One 模型)概念迅速获得行业关注。其核心思路是:取一个预训练 LLM 的躯干(Torso),去掉生成文本的能力,换上一个在选项间打分的头部。牺牲灵活性换取速度、准确性和可控性——永远输出预设选项之一,而非自由文本。

AWS 杰出工程师 Marc Brooker 在看到 Jev 后尝试自己实现,项目成功到一度登上 JevBench 排行榜同级别第一,于是 AWS 将其清理后作为 Strands Labs 项目正式发布。

Strands Decider 2B 的技术架构

底座与改造

  • 基座模型:Qwen3.5-2B(阿里巴巴开源)
  • 改造方式:移除 LM Head(语言模型头),替换为 Pointer Head(指针打分头)
  • Pointer Head 参数量:约 100 万(1M+),远小于基座
  • 微调方式:Rank-16 LoRA 适配器
  • 当前发布版本:v19(经过 19 次架构迭代)

Pointer Head 的工作原理是:用每个选项位置的隐藏状态(Hidden State)与 <answer> 位置的隐藏状态进行打分,一次前向传播即可输出所有选项的概率分布。这比让 LLM 逐 token 生成答案快几个数量级。

支持的题型

题型说明示例
noul(是非题)返回 Yes/No + 置信度"参数值是否来自用户实际输入?"
choice(多选一)在 N 个选项中选择 + 置信度"该转给哪个团队?billing/sales/retail"
score(有序量表)返回 0-1 之间的分数"这句话的情感是否正面?"

每种题型都附带校准后的置信度分数,这是前沿 LLM 推理 API 无法直接提供的。

性能数据:JevBench 与延迟

准确率与校准

JevBench 是 TypeSafe 发布的决策模型公开评测集。Strands Decider 2B 在公开集上的表现:

  • 准确率:167/231 ≈ 72.3%
  • Brier 分数(校准度):约 0.348(越低越好)
  • ECE(期望校准误差):约 0.050
  • 排名:2B 参数级别 33 个模型中第 3;剔除刚超过 2B 的模型后第 1

内部评测集表现:held-out short 0.641(n=6000)、ContractNLI 0.872、MuSiQue 0.884。

延迟

硬件中位延迟备注
NVIDIA RTX 3090~115ms延迟随 task token 数近似线性增长
Apple M3 MacBook~153ms小任务表现,与 RTX 3090 差距不大

关键优势:决策延迟随任务大小近似线性增长,没有 LLM 的 KV Cache 膨胀问题。115ms 的延迟意味着它可以放在 LLM 调用根本无法承受的路径上——比如每次工具调用前的参数检查。

实战应用:Agent 工作流中的门控

安装与使用

terminal
pip install strands-decider

基本调用示例

terminal
strands-decider ask StrandsAgents/strands-decider-2B-hobson-v19   --state "Help! My payouts have been failing for 3 days!"   --choice "Which team should handle this?=billing,sales,retail"

输出:

code
choice_0 -> billing (confidence 0.768)
  billing                  0.845
  retail                   0.091
  sales                    0.064

before_tool_call 门控示例

Strands Decider 最典型的落地场景是挂在 Agent 的 InterventionHandler.before_tool_call 上,在工具执行前做两项检查:

  1. 参数 grounding 检查:"工具参数值是否追溯到用户实际提供的事实?"(是/否)
  2. 时机检查:"现在调工具是否过早,应该先向用户澄清?"(是/否)

如果参数是 Agent 猜的(用户没说过),或时机不对,决策模型返回 Deny 或 Guide,阻止工具执行并让 Agent 回去问用户。整个过程在 115ms 内完成,用户几乎无感。

混合 Agent 架构

更成熟的用法是构建混合 Agent:用决策模型处理简单高频决策(100% 正确率的"简单任务"),用前沿 LLM 处理复杂推理。这种分工可以显著降低成本和延迟,同时保持决策质量。

开源与可复现性

Strands Decider 2B 的开源程度非常彻底:

Marc Brooker 在 TechCrunch 采访中表示,这类模型的构建成本在"几百到几千美元"级别,不一定需要前沿实验室的资源。TypeSafe CEO Diogo Almeida 则提醒,当前多数模仿者更像"想实现酷架构的 ML 人",而非"深度投入让智能真正有用的团队"。

已知局限

AWS 在发布中坦诚列出了模型的局限:

  1. 长文档多步推理弱:在需要多步推理的长文档任务上表现不佳
  2. 问句敏感:换一种问法可能得到相同答案(缺乏真正的推理能力)
  3. score/noul 迁移差:更换评分标准后,模型表现可能大幅下降
  4. 非通用 LLM:不能用于编程、聊天、文档摘要等需要文本生成的任务

上线前务必用自己的实际流量标定阈值——这是 AWS 官方的建议,不要直接拿默认参数进生产。

行业趋势:决策模型赛道升温

Strands Decider 2B 的发布是决策模型赛道快速升温的一个缩影:

  • 2026-09-18:TypeSafe AI 发布 Jev,开创决策模型品类
  • 2026-09-28:Marc Brooker 个人实现版本登上 JevBench 同级别第一
  • 2026-09-30:OpenAI 宣布类似 Jev 的决策模型产品
  • 2026-10-01:AWS Strands Labs 发布 Strands Decider 2B
  • 2026-10-02:Cloudflare 发布 Clef 决策模型(已在上一轮发布)

TechCrunch 指出,"数十个类似模型"已在 TypeSafe 发布 Jev 后的短短两周内涌现。决策模型可能成为 AI Agent 基础设施的标配组件——就像路由器之于网络,决策模型之于 Agent 工作流。

开发者行动建议

  1. 立即试用:pip install strands-decider,用 CLI 跑几个示例感受输出格式
  2. 识别场景:检查你的 Agent 工作流中哪些决策是"在有限选项里选一个"——这些都可以用决策模型替代 LLM 调用
  3. 标定阈值:用自己的实际流量测试置信度阈值,找到 Proceed/Deny/Guide 的分界线
  4. 混合架构:不要试图用决策模型替代所有 LLM 调用,而是构建"决策模型做简单决策 + LLM 做复杂推理"的混合流水线
  5. 关注校准:Brier 分数和 ECE 比准确率更重要——一个 72% 准确但校准良好的模型,比 85% 准确但过度自信的模型更有用

信息来源:Strands Agents 官方博客、TechCrunch 报道、GitHub 仓库、Hugging Face 权重、JevBench 排行榜

AWSStrands Deciderdecision modelopen source AIagent routingJevQwen3.5AI cost optimization

查看原文 →

仅供学习参考:案例基于公开来源整理,并可能经 AI 辅助起草、由编辑复核。不构成投资或收益建议,亦不保证结果。