WayToClawEarn
中等影响TechNode

蚂蚁百灵 Ling-3.1-flash 发布:560B 参数 25B 激活、百万上下文、试用后开源,国产 Agent 模型怎么选?

蚂蚁集团旗下 InclusionAI 于 9 月 30 日发布 Ling-3.1-flash:总参数 5600 亿、每 token 激活约 250 亿的 MoE 模型,设计上下文窗口 100 万 token,面向 Agent 任务、搜索、办公和专业领域。启动两周免费试用(上限 25.6 万 token),试用结束后计划开放完整上下文并开源权重。8 项自报基准覆盖编码、智能体和知识三大类,但尚无第三方独立验证。

Edisen Lu · WayToClawEarn来源 TechNode发布 2026年10月3日

基于公开来源复核 · AI 辅助整理,编辑把关。 内容方法 · 原始来源

公开来源汇编

综合公开帖文/文档整理。一手主张请优先核对原始来源。

我们如何审核内容 · 一手来源 · TechNode

核心结论

蚂蚁集团旗下 InclusionAI(蚂蚁百灵)于 2026 年 9 月 30 日正式发布 Ling-3.1-flash 语言模型。该模型采用混合专家(Mixture of Experts)架构,总参数量约 5600 亿,每 token 激活参数约 250 亿,激活率不到 5%。设计上下文窗口上限为 100 万 token,当前两周免费试用期间限制为 25.6 万 token。模型定位于智能体(Agent)任务、搜索、办公软件及医疗、金融、材料科学等垂直领域。试用结束后,百灵计划开放完整的 100 万 token 上下文能力,并将模型权重开源。目前已通过 Vercel AI Gateway(接入 Novita)和 OpenRouter 提供免费 API 调用,模型 ID 为 inclusionai/ling-3.1-flash。

关键规格

维度参数
发布日期2026 年 9 月 30 日
发布方蚂蚁集团 InclusionAI(蚂蚁百灵)
架构Mixture of Experts(MoE)
总参数量约 5600 亿(560B)
每 token 激活参数约 250 亿(25B)
激活率< 5%
设计上下文窗口1,000,000 token(1M)
试用期间上下文262,144 token(256K)
最大输出长度32,768 token
定价试用期间免费(截至约 10 月 13 日);试用后付费方案尚未公布
开源计划试用结束后开源权重(许可证未公布)
可用渠道Vercel AI Gateway(Novita)、OpenRouter
API 模型 IDinclusionai/ling-3.1-flash
前代产品Ling-3.0-flash(124B 总参 / 5.1B 激活)

架构与定位分析

Ling-3.1-flash 延续了 flash 系列的 MoE 路线,但参数量较前代大幅跃升。上一代 Ling-3.0-flash 为 124B 总参数、5.1B 激活,新一代在总量上放大约 4.5 倍,激活量同步放大约 5 倍。这一设计的核心思路是:用更大的参数储备换取更强的模型能力,同时通过极低的激活率控制单次推理的计算成本。

百万级上下文窗口是该模型的另一个核心卖点。Ling-3.1-flash 的设计目标为 100 万 token,这一规格使其能够处理超长文档、完整代码库和长链路 Agent 工作流。试用期间的 25.6 万 token 限制对大多数长文档和 Agent 试点场景已够用,但完整的百万窗口才是其差异化竞争力的关键所在。

官方将 Ling-3.1-flash 定位于四个方向:智能体任务、搜索、办公软件和专业应用。这一定位与蚂蚁百灵近期的产品策略一脉相承。此前发布的金融增强模型 Ling-3.0-flash-Fin(MIT 许可,124B 总参 / 5.5B 激活)瞄准投研工作流,Ling-3.0-flash-VL 则是首个原生多模态模型。Ling-3.1 作为通用底座,在参数规模和上下文能力上全面升级,为这类长链路任务提供了更强的基础设施。

基准数据:8 项自报成绩,均未经第三方验证

根据 BenchLM 追踪数据,Ling-3.1-flash 公布了 8 项基准成绩,全部来自蚂蚁百灵发布截图(X/Twitter @AntLingAGI),尚无任何第三方独立评测结果。各维度得分及与当前已验证领先者的对比如下:

编码类

基准Ling-3.1-flash已验证领先者差距
TerminalBench40.4%Ling-3.1-flash 自身(当前最高已验证分)—
SWE-Atlas Codebase QnA55.9%Muse Spark 1.3(59.4%)-3.5

智能体类

基准Ling-3.1-flash已验证领先者差距
AutomationBench52.5%DeepSeek V4.1 Flash(54.8%)-2.3
SkillsBench68.7%Qwen3.8 Max(70.2%)-1.5
CyberGym87.9%MiMo-V2.6-Flash(95.1%)-7.2
Finance Agent v257.9%Gemini 4 Argon(65.4%)-7.5
DRACO85.5%Claude Opus 5(88.6%)-3.1

知识类

基准Ling-3.1-flash已验证领先者差距
HealthBench Professional65.3%Claude Sonnet 5.5(69.2%)-3.9

需要注意的是,以上基准的评测工具链和评分设置均未公开文档化。HealthBench Professional 在"AQ 环境"中评测,且标注的医疗能力目前仅在 AQ 环境可用。这些是厂商自报结果,不构成独立测量或临床认证。

开源策略与时间表

Ling-3.1-flash 采取"先试用、后开源"的发布节奏。两周免费试用是这次发布中最务实的部分:开发者无需付费即可上手验证,试用期间 25.6 万 token 的上限对大多数长文档和 Agent 试点场景已够用。

试用结束后,官方计划开放完整的 100 万 token 上下文窗口并开源模型权重。参考 OrcaRouter 记录,Ling-3.0-Flash 从发布到开源权重之间存在约两周间隔,因此 Ling-3.1-flash 的开源预计在 10 月中旬前后。但开源的具体许可协议和权重发布时间尚未确认——这两点将直接决定 Ling-3.1-flash 能否真正进入国产开源第一梯队的实战序列。

此前蚂蚁百灵已开源过 Ling 系列的 tiny 和 flash 基础模型(如 Ling-3.0-flash-Fin 采用 MIT 许可)。如果 Ling-3.1-flash 沿用 MIT 或 Apache 2.0 许可,5600 亿参数级别的开源模型将为国内开发者提供一个在 DeepSeek V4、Qwen3.8 之外的新选项。

国产开源模型生态格局

Ling-3.1-flash 的发布进一步丰富了国产大模型矩阵。当前国产开源第一梯队的主要选手包括:

  • DeepSeek V4:1M 上下文、API 兼容 OpenAI/Anthropic、零 CUDA 依赖
  • Qwen3.8 系列:27B 到 2.4T 多规格,Apache 2.0 许可,Hugging Face 下载量领先
  • Kimi-K3:Moonshot 旗下的长上下文模型
  • Ling 系列:蚂蚁百灵出品,金融和多模态方向有专用变体

Ling-3.1-flash 的差异化在于:560B 总参 / 25B 激活的 MoE 配置在"总参数量"上领先同梯队竞品,但"激活参数"仍控制在 25B 级别,理论上可以在合理硬件上实现部署。百万级上下文窗口则是对标 Gemini 4 Argon(1M 输出 token)和 DeepSeek V4(1M 上下文)的关键能力。

选型建议

对于正在评估 Agent LLM 的开发者和企业,Ling-3.1-flash 值得在以下场景验证:

  1. 长上下文 Agent 场景:需要处理数十份文档、多轮工具调用的 Agent 工作流,百万 token 窗口是核心需求
  2. 金融/医疗垂直应用:蚂蚁百灵此前在金融方向的积累(Ling-3.0-flash-Fin)可能在该模型上有延续
  3. 成本敏感的大规模部署:25B 激活的 MoE 在推理成本上有天然优势,待开源后可评估私有化部署的硬件需求

验证时重点关注两个维度:长上下文下的有效记忆长度(不能只看标称窗口,需测试信息检索准确率随上下文增长的变化),以及 Agent 多步任务的稳定性和工具调用准确率。

同时建议关注开源落地后的两个关键信号:许可协议(MIT/Apache 2.0 为商用友好,自定义许可需仔细审查)和权重发布时间。这两个信号决定了 Ling-3.1-flash 是"又一个参数竞赛的参与者"还是"真正可进入生产部署的选项"。

来源

Ant GroupInclusionAILing 3.1 FlashMoEopen source LLMAI agentChinese AI modelslarge language model

查看原文 →

仅供学习参考:案例基于公开来源整理,并可能经 AI 辅助起草、由编辑复核。不构成投资或收益建议,亦不保证结果。