蚂蚁百灵 Ling-3.1-flash 发布:560B 参数 25B 激活、百万上下文、试用后开源,国产 Agent 模型怎么选?
蚂蚁集团旗下 InclusionAI 于 9 月 30 日发布 Ling-3.1-flash:总参数 5600 亿、每 token 激活约 250 亿的 MoE 模型,设计上下文窗口 100 万 token,面向 Agent 任务、搜索、办公和专业领域。启动两周免费试用(上限 25.6 万 token),试用结束后计划开放完整上下文并开源权重。8 项自报基准覆盖编码、智能体和知识三大类,但尚无第三方独立验证。
核心结论
蚂蚁集团旗下 InclusionAI(蚂蚁百灵)于 2026 年 9 月 30 日正式发布 Ling-3.1-flash 语言模型。该模型采用混合专家(Mixture of Experts)架构,总参数量约 5600 亿,每 token 激活参数约 250 亿,激活率不到 5%。设计上下文窗口上限为 100 万 token,当前两周免费试用期间限制为 25.6 万 token。模型定位于智能体(Agent)任务、搜索、办公软件及医疗、金融、材料科学等垂直领域。试用结束后,百灵计划开放完整的 100 万 token 上下文能力,并将模型权重开源。目前已通过 Vercel AI Gateway(接入 Novita)和 OpenRouter 提供免费 API 调用,模型 ID 为 inclusionai/ling-3.1-flash。
关键规格
| 维度 | 参数 |
|---|---|
| 发布日期 | 2026 年 9 月 30 日 |
| 发布方 | 蚂蚁集团 InclusionAI(蚂蚁百灵) |
| 架构 | Mixture of Experts(MoE) |
| 总参数量 | 约 5600 亿(560B) |
| 每 token 激活参数 | 约 250 亿(25B) |
| 激活率 | < 5% |
| 设计上下文窗口 | 1,000,000 token(1M) |
| 试用期间上下文 | 262,144 token(256K) |
| 最大输出长度 | 32,768 token |
| 定价 | 试用期间免费(截至约 10 月 13 日);试用后付费方案尚未公布 |
| 开源计划 | 试用结束后开源权重(许可证未公布) |
| 可用渠道 | Vercel AI Gateway(Novita)、OpenRouter |
| API 模型 ID | inclusionai/ling-3.1-flash |
| 前代产品 | Ling-3.0-flash(124B 总参 / 5.1B 激活) |
架构与定位分析
Ling-3.1-flash 延续了 flash 系列的 MoE 路线,但参数量较前代大幅跃升。上一代 Ling-3.0-flash 为 124B 总参数、5.1B 激活,新一代在总量上放大约 4.5 倍,激活量同步放大约 5 倍。这一设计的核心思路是:用更大的参数储备换取更强的模型能力,同时通过极低的激活率控制单次推理的计算成本。
百万级上下文窗口是该模型的另一个核心卖点。Ling-3.1-flash 的设计目标为 100 万 token,这一规格使其能够处理超长文档、完整代码库和长链路 Agent 工作流。试用期间的 25.6 万 token 限制对大多数长文档和 Agent 试点场景已够用,但完整的百万窗口才是其差异化竞争力的关键所在。
官方将 Ling-3.1-flash 定位于四个方向:智能体任务、搜索、办公软件和专业应用。这一定位与蚂蚁百灵近期的产品策略一脉相承。此前发布的金融增强模型 Ling-3.0-flash-Fin(MIT 许可,124B 总参 / 5.5B 激活)瞄准投研工作流,Ling-3.0-flash-VL 则是首个原生多模态模型。Ling-3.1 作为通用底座,在参数规模和上下文能力上全面升级,为这类长链路任务提供了更强的基础设施。
基准数据:8 项自报成绩,均未经第三方验证
根据 BenchLM 追踪数据,Ling-3.1-flash 公布了 8 项基准成绩,全部来自蚂蚁百灵发布截图(X/Twitter @AntLingAGI),尚无任何第三方独立评测结果。各维度得分及与当前已验证领先者的对比如下:
编码类
| 基准 | Ling-3.1-flash | 已验证领先者 | 差距 |
|---|---|---|---|
| TerminalBench | 40.4% | Ling-3.1-flash 自身(当前最高已验证分) | — |
| SWE-Atlas Codebase QnA | 55.9% | Muse Spark 1.3(59.4%) | -3.5 |
智能体类
| 基准 | Ling-3.1-flash | 已验证领先者 | 差距 |
|---|---|---|---|
| AutomationBench | 52.5% | DeepSeek V4.1 Flash(54.8%) | -2.3 |
| SkillsBench | 68.7% | Qwen3.8 Max(70.2%) | -1.5 |
| CyberGym | 87.9% | MiMo-V2.6-Flash(95.1%) | -7.2 |
| Finance Agent v2 | 57.9% | Gemini 4 Argon(65.4%) | -7.5 |
| DRACO | 85.5% | Claude Opus 5(88.6%) | -3.1 |
知识类
| 基准 | Ling-3.1-flash | 已验证领先者 | 差距 |
|---|---|---|---|
| HealthBench Professional | 65.3% | Claude Sonnet 5.5(69.2%) | -3.9 |
需要注意的是,以上基准的评测工具链和评分设置均未公开文档化。HealthBench Professional 在"AQ 环境"中评测,且标注的医疗能力目前仅在 AQ 环境可用。这些是厂商自报结果,不构成独立测量或临床认证。
开源策略与时间表
Ling-3.1-flash 采取"先试用、后开源"的发布节奏。两周免费试用是这次发布中最务实的部分:开发者无需付费即可上手验证,试用期间 25.6 万 token 的上限对大多数长文档和 Agent 试点场景已够用。
试用结束后,官方计划开放完整的 100 万 token 上下文窗口并开源模型权重。参考 OrcaRouter 记录,Ling-3.0-Flash 从发布到开源权重之间存在约两周间隔,因此 Ling-3.1-flash 的开源预计在 10 月中旬前后。但开源的具体许可协议和权重发布时间尚未确认——这两点将直接决定 Ling-3.1-flash 能否真正进入国产开源第一梯队的实战序列。
此前蚂蚁百灵已开源过 Ling 系列的 tiny 和 flash 基础模型(如 Ling-3.0-flash-Fin 采用 MIT 许可)。如果 Ling-3.1-flash 沿用 MIT 或 Apache 2.0 许可,5600 亿参数级别的开源模型将为国内开发者提供一个在 DeepSeek V4、Qwen3.8 之外的新选项。
国产开源模型生态格局
Ling-3.1-flash 的发布进一步丰富了国产大模型矩阵。当前国产开源第一梯队的主要选手包括:
- DeepSeek V4:1M 上下文、API 兼容 OpenAI/Anthropic、零 CUDA 依赖
- Qwen3.8 系列:27B 到 2.4T 多规格,Apache 2.0 许可,Hugging Face 下载量领先
- Kimi-K3:Moonshot 旗下的长上下文模型
- Ling 系列:蚂蚁百灵出品,金融和多模态方向有专用变体
Ling-3.1-flash 的差异化在于:560B 总参 / 25B 激活的 MoE 配置在"总参数量"上领先同梯队竞品,但"激活参数"仍控制在 25B 级别,理论上可以在合理硬件上实现部署。百万级上下文窗口则是对标 Gemini 4 Argon(1M 输出 token)和 DeepSeek V4(1M 上下文)的关键能力。
选型建议
对于正在评估 Agent LLM 的开发者和企业,Ling-3.1-flash 值得在以下场景验证:
- 长上下文 Agent 场景:需要处理数十份文档、多轮工具调用的 Agent 工作流,百万 token 窗口是核心需求
- 金融/医疗垂直应用:蚂蚁百灵此前在金融方向的积累(Ling-3.0-flash-Fin)可能在该模型上有延续
- 成本敏感的大规模部署:25B 激活的 MoE 在推理成本上有天然优势,待开源后可评估私有化部署的硬件需求
验证时重点关注两个维度:长上下文下的有效记忆长度(不能只看标称窗口,需测试信息检索准确率随上下文增长的变化),以及 Agent 多步任务的稳定性和工具调用准确率。
同时建议关注开源落地后的两个关键信号:许可协议(MIT/Apache 2.0 为商用友好,自定义许可需仔细审查)和权重发布时间。这两个信号决定了 Ling-3.1-flash 是"又一个参数竞赛的参与者"还是"真正可进入生产部署的选项"。
来源
- TechNode 报道(2026-09-30):https://technode.com/2026/09/30/ant-group-launches-ling-3-1-flash-with-560-billion-parameters/
- IT 之家报道(2026-09-30):https://www.ithome.com/1/008/907.htm
- InclusionAI 官方 X/Twitter:https://x.com/AntLingAGI
- Vercel AI Gateway 模型页面:https://vercel.com/ai-gateway/models/ling-3.1-flash
- BenchLM 基准追踪:https://benchlm.ai/models/ling-3-1-flash
- LLM Reference 模型页面:https://www.llmreference.com/model/ling-3.1-flash
- AI Weekly 报道(2026-09-30):https://aiweekly.co/alerts/ants-inclusionai-ships-ling-31-flash-with-560b-parameters
主题中心
AI Agent 教程与工作流指南
比新闻更常青:按步骤搭建编程 Agent、内容流水线与 n8n 自动化,并链接到真实赚钱案例。
进入「AI Agent 教程与工作流指南」 →赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →