AWS 开源 Strands Decider 2B 决策模型:不生成文本只返回概率,AI Agent 路由怎么降本?
AWS Strands Labs 发布 Strands Decider 2B 开源决策模型,基于 Qwen3.5-2B 躯干去除 LM Head 并替换为指针打分头,在 JevBench 公开集达到 72.3% 准确率,本地 RTX 3090 中位延迟 115ms。该模型不生成自由文本,而是在预设选项间做选择并输出置信度分数,适合 Agent 工作流中的模型路由、工具门控、参数 grounding 检查等高频低复杂度决策,降低对前沿 LLM 的依赖和调用成本。
核心结论
AWS Strands Labs 于 2026 年 10 月 1 日发布 Strands Decider 2B 开源决策模型。该模型基于 Qwen3.5-2B 躯干构建,移除了语言模型头(LM Head),替换为一个约百万参数的指针打分头(Pointer Head),在 JevBench 公开测试集上达到 72.3% 准确率(167/231),本地 RTX 3090 中位延迟约 115ms。模型采用 Apache-2.0 协议完全开源,包含训练数据和脚本,可直接通过 pip install strands-decider 安装使用。
这标志着"决策模型"(Decision Model)这一新品类正在从 TypeSafe Jev 的首创走向行业普及。决策模型不生成自由文本,而是在预设选项间做选择并输出校准置信度分数,专为 AI Agent 工作流中的高频低复杂度决策设计——模型路由、工具选择、参数 grounding 检查、策略分类——以极低延迟和成本替代不必要的 LLM 调用。
什么是决策模型?为什么 Agent 开发者需要它?
在 AI Agent 工作流中,大量决策本质上是"在有限选项里选一个":用户说"打开灯",该调哪个工具?参数是否来自用户真实输入?现在调工具是否过早?这些问题用 GPT-6 或 Claude Opus 5.5 回答,既慢又贵,且无法提供可靠的置信度分数。
TypeSafe AI 在 2026 年 9 月中旬推出 Jev 模型后,"决策模型"(也叫 System One 模型)概念迅速获得行业关注。其核心思路是:取一个预训练 LLM 的躯干(Torso),去掉生成文本的能力,换上一个在选项间打分的头部。牺牲灵活性换取速度、准确性和可控性——永远输出预设选项之一,而非自由文本。
AWS 杰出工程师 Marc Brooker 在看到 Jev 后尝试自己实现,项目成功到一度登上 JevBench 排行榜同级别第一,于是 AWS 将其清理后作为 Strands Labs 项目正式发布。
Strands Decider 2B 的技术架构
底座与改造
- 基座模型:Qwen3.5-2B(阿里巴巴开源)
- 改造方式:移除 LM Head(语言模型头),替换为 Pointer Head(指针打分头)
- Pointer Head 参数量:约 100 万(1M+),远小于基座
- 微调方式:Rank-16 LoRA 适配器
- 当前发布版本:v19(经过 19 次架构迭代)
Pointer Head 的工作原理是:用每个选项位置的隐藏状态(Hidden State)与 <answer> 位置的隐藏状态进行打分,一次前向传播即可输出所有选项的概率分布。这比让 LLM 逐 token 生成答案快几个数量级。
支持的题型
| 题型 | 说明 | 示例 |
|---|---|---|
| noul(是非题) | 返回 Yes/No + 置信度 | "参数值是否来自用户实际输入?" |
| choice(多选一) | 在 N 个选项中选择 + 置信度 | "该转给哪个团队?billing/sales/retail" |
| score(有序量表) | 返回 0-1 之间的分数 | "这句话的情感是否正面?" |
每种题型都附带校准后的置信度分数,这是前沿 LLM 推理 API 无法直接提供的。
性能数据:JevBench 与延迟
准确率与校准
JevBench 是 TypeSafe 发布的决策模型公开评测集。Strands Decider 2B 在公开集上的表现:
- 准确率:167/231 ≈ 72.3%
- Brier 分数(校准度):约 0.348(越低越好)
- ECE(期望校准误差):约 0.050
- 排名:2B 参数级别 33 个模型中第 3;剔除刚超过 2B 的模型后第 1
内部评测集表现:held-out short 0.641(n=6000)、ContractNLI 0.872、MuSiQue 0.884。
延迟
| 硬件 | 中位延迟 | 备注 |
|---|---|---|
| NVIDIA RTX 3090 | ~115ms | 延迟随 task token 数近似线性增长 |
| Apple M3 MacBook | ~153ms | 小任务表现,与 RTX 3090 差距不大 |
关键优势:决策延迟随任务大小近似线性增长,没有 LLM 的 KV Cache 膨胀问题。115ms 的延迟意味着它可以放在 LLM 调用根本无法承受的路径上——比如每次工具调用前的参数检查。
实战应用:Agent 工作流中的门控
安装与使用
pip install strands-decider基本调用示例
strands-decider ask StrandsAgents/strands-decider-2B-hobson-v19 --state "Help! My payouts have been failing for 3 days!" --choice "Which team should handle this?=billing,sales,retail"输出:
choice_0 -> billing (confidence 0.768)
billing 0.845
retail 0.091
sales 0.064before_tool_call 门控示例
Strands Decider 最典型的落地场景是挂在 Agent 的 InterventionHandler.before_tool_call 上,在工具执行前做两项检查:
- 参数 grounding 检查:"工具参数值是否追溯到用户实际提供的事实?"(是/否)
- 时机检查:"现在调工具是否过早,应该先向用户澄清?"(是/否)
如果参数是 Agent 猜的(用户没说过),或时机不对,决策模型返回 Deny 或 Guide,阻止工具执行并让 Agent 回去问用户。整个过程在 115ms 内完成,用户几乎无感。
混合 Agent 架构
更成熟的用法是构建混合 Agent:用决策模型处理简单高频决策(100% 正确率的"简单任务"),用前沿 LLM 处理复杂推理。这种分工可以显著降低成本和延迟,同时保持决策质量。
开源与可复现性
Strands Decider 2B 的开源程度非常彻底:
- 代码仓库:github.com/strands-labs/strands-decider(Apache-2.0)
- 模型权重:huggingface.co/StrandsAgents/strands-decider-2B-hobson-v19
- 训练数据:全部公开
- 训练脚本:
training/recipe.sh,H100 集群约 1 小时,单卡 3090 约 11 小时 - 版本演进记录:从 v1 到 v19 的每次改动都有记录,可追踪架构演进
Marc Brooker 在 TechCrunch 采访中表示,这类模型的构建成本在"几百到几千美元"级别,不一定需要前沿实验室的资源。TypeSafe CEO Diogo Almeida 则提醒,当前多数模仿者更像"想实现酷架构的 ML 人",而非"深度投入让智能真正有用的团队"。
已知局限
AWS 在发布中坦诚列出了模型的局限:
- 长文档多步推理弱:在需要多步推理的长文档任务上表现不佳
- 问句敏感:换一种问法可能得到相同答案(缺乏真正的推理能力)
- score/noul 迁移差:更换评分标准后,模型表现可能大幅下降
- 非通用 LLM:不能用于编程、聊天、文档摘要等需要文本生成的任务
上线前务必用自己的实际流量标定阈值——这是 AWS 官方的建议,不要直接拿默认参数进生产。
行业趋势:决策模型赛道升温
Strands Decider 2B 的发布是决策模型赛道快速升温的一个缩影:
- 2026-09-18:TypeSafe AI 发布 Jev,开创决策模型品类
- 2026-09-28:Marc Brooker 个人实现版本登上 JevBench 同级别第一
- 2026-09-30:OpenAI 宣布类似 Jev 的决策模型产品
- 2026-10-01:AWS Strands Labs 发布 Strands Decider 2B
- 2026-10-02:Cloudflare 发布 Clef 决策模型(已在上一轮发布)
TechCrunch 指出,"数十个类似模型"已在 TypeSafe 发布 Jev 后的短短两周内涌现。决策模型可能成为 AI Agent 基础设施的标配组件——就像路由器之于网络,决策模型之于 Agent 工作流。
开发者行动建议
- 立即试用:
pip install strands-decider,用 CLI 跑几个示例感受输出格式 - 识别场景:检查你的 Agent 工作流中哪些决策是"在有限选项里选一个"——这些都可以用决策模型替代 LLM 调用
- 标定阈值:用自己的实际流量测试置信度阈值,找到 Proceed/Deny/Guide 的分界线
- 混合架构:不要试图用决策模型替代所有 LLM 调用,而是构建"决策模型做简单决策 + LLM 做复杂推理"的混合流水线
- 关注校准:Brier 分数和 ECE 比准确率更重要——一个 72% 准确但校准良好的模型,比 85% 准确但过度自信的模型更有用
信息来源:Strands Agents 官方博客、TechCrunch 报道、GitHub 仓库、Hugging Face 权重、JevBench 排行榜
主题中心
AI Agent 教程与工作流指南
比新闻更常青:按步骤搭建编程 Agent、内容流水线与 n8n 自动化,并链接到真实赚钱案例。
进入「AI Agent 教程与工作流指南」 →赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →