Aleph Alpha 开源 Kolibri:78B 参数 3.46B 激活的德英 MoE,主权 AI 怎么选?
德国 Aleph Alpha 在统一日(10月3日)发布 Kolibri 开源模型:78.1B 总参数、3.46B 激活的德英双语 MoE,支持百万 Token 上下文,采用 Merlin-Arthur 消幻觉训练协议和精确分位数均衡路由,Apache 2.0 许可证可商用,768 块 B200 GPU 训练 21 天完成 20T Token 预训练。
核心结论
2026 年 10 月 3 日德国统一日,Aleph Alpha 发布 Kolibri 开源模型:78.1B 总参数、3.46B 激活的德英双语 MoE,Apache 2.0 许可证,支持百万 Token 上下文。这不是又一个"缩小版 GPT"——它是一个从分词器到训练协议全面原创的主权 AI 方案,在 3B 级别激活参数下打出了接近 12B 激活模型的质量。
架构与参数
Kolibri 的核心参数:
| 指标 | 数值 |
|---|---|
| 总参数量 | 78.1B |
| 激活参数量 | 3.46B(每 Token) |
| 专家数量 | 384 总 / 6 激活 + 1 共享专家 |
| 层数 | 50(全部 MoE) |
| 注意力头 | 48 query / 4 KV |
| 模型维度 | 2,560 |
| 词表大小 | 128,000 |
| 最大上下文 | 1,000,000(1M Token) |
| 预训练 Token 数 | 20T(从 200T+ 原始数据处理) |
| 知识截止 | 英语 2024-09-01,德语 2025-08-01,综合 2026-06-18 |
架构上的三个关键设计选择值得关注:
384 个小专家而非少数宽专家。 Aleph Alpha 在消融实验中发现,相同总参数预算下,更多更窄的专家比更少更宽的专家表现更好。这与 Qwen3.8 的 128 专家方案不同,走的是更极致的稀疏路线。
精确分位数均衡路由。 这是 Kimi K3 估计式均衡的改进版——在固定计算开销下精确计算而非估计,且开销与批量大小无关。实际效果是更好的负载均衡和更高的模型质量。
滑动窗口注意力 + 每 5 层全注意力。 40 层使用 512 Token 窗口的滑动注意力,10 层(每 5 层一次)使用全注意力。这种混合方案在长上下文场景下兼顾效率和信息聚合。
训练细节
训练硬件和时间线:
- GPU:768 块 NVIDIA B200
- 预训练时长:21 天
- 阶段 1:20T Token,16K 序列长度(21 天)
- 阶段 2:3.44T Token 中期训练,64K 序列长度
- 阶段 3:200B Token 长上下文适配,256K 序列长度
- 总训练量:约 24T Token
- 中断:21 天内 38 次非计划中断(约每 10,000 GPU 小时 1 次),全部自动恢复
后训练阶段:
- SFT:生成 174B Token 合成数据,与开源数据集合合并为 268B Token 训练集
- RL:120 万条精选任务,覆盖代码/数学推理、Agent 任务、指令遵循、问答、工具调用
- 训练方法:异步训练(生成与训练并行)
预训练数据语言分布:英语约 62%,德语约 21.3%(约 4.3T Token),代码约 14%。德语数据中仅 6% 是翻译来的,其余为原生德语或改写德语。
Merlin-Arthur 消幻觉协议
Kolibri 最具创新性的设计是 Merlin-Arthur 三玩家训练博弈,专门用于降低幻觉:
- Arthur:被训练和最终发布的模型
- Merlin:生成能提高 Arthur 正确回答概率的上下文
- Morgana:从上下文中剥离证据,诱导 Arthur 幻觉
训练目标:Arthur 必须学会回答 Merlin 提供的上下文,同时对 Morgana 被删减的上下文保持克制——即使猜对了也不算通过。这迫使模型真正"读懂"上下文而非猜测。
基准测试验证了这一设计。在 AA-Omniscience 非幻觉指标上,Kolibri 得分 44.0,远超 Kolibri Origin 的 14.8 和 Nemotron 3 Super 的 13.9。在 M/A Grounding Score(综合幻觉控制评分)上,Kolibri 得分 0.23,是所有对比模型中最高的。
基准表现
与同级别模型的对比(精选关键基准):
| 基准 | Kolibri | Qwen3.6-35B-A3B | Nemotron 3 Super 120B-A12B | Mistral Small 4 119B-A6B |
|---|---|---|---|---|
| AIME 2025 | 96.9 | 84.6 | 91.7 | 79.8 |
| AIME 2025(德语) | 87.5 | 82.9 | 85.6 | 72.3 |
| GPQA Diamond | 84.3 | 83.4 | 78.0 | 74.7 |
| LiveCodeBench v6 | 85.9 | 82.5 | 82.0 | 71.2 |
| HumanEval+ | 92.7 | 92.8 | 94.7 | 92.8 |
| BFCL v4 | 61.4 | 67.2 | 61.0 | 58.0 |
| τ²-bench telecom | 94.7 | 99.1 | 68.1 | 41.5 |
| τ³-bench banking | 38.1 | 10.6 | 15.5 | 5.7 |
关键发现:Kolibri(3B 激活)在多数基准上接近甚至超过了 Nemotron 3 Super(12B 激活,120B 总参)——一个激活参数量约 4 倍的模型。但 Nemotron 3 Super 在 Overall(EN)75.5 vs 80.2、Overall(DE)70.8 vs 79.9 上仍领先。
在行业内部基准上,Kolibri 表现突出:汽车供应链 99.0,德国公共部门 75.0,半导体行业 80.4,航空航天 58.9。
双语分词器
Kolibri 使用自研的 UniBPE 分词器,结合了 BPE 的自底向上方法和 Unigram 的训练目标。在德语文本上的压缩率:4.90 bytes/token,虽然略逊于 DeepSeek V4 的 3.72 和 Gemini 的 4.13,但在德语形态学拆分上更精准。
例如 "Bundessozialgerichtes"(联邦社会法院的),Kolibri 拆分为 "Bundes|sozial|gericht|es",而竞品通常拆分为 "Bund|ess|oz|ial|gericht|es"——后者在语义层面是错误的。
四级可控推理
Kolibri 支持四种推理强度:none / low / medium / high。用户可以根据任务复杂度和成本预算选择:
- none:无推理链,适合简单问答
- low:轻量推理,适合标准任务
- medium:中等推理,适合复杂分析
- high:深度推理,适合数学证明和复杂代码
这使部署方能在同一模型上按任务灵活控制成本和延迟。
部署方式
Kolibri 可通过 vLLM 部署:
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice扩展到百万上下文:
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice \
--max-model-len 1048576 \
--hf-overrides '{"max_position_embeddings": 1048576}'推荐采样参数:temperature 1.0,top_p 0.97,top_k 128。
效率数据:78B 模型在两块 H100 上可同时处理 18 个 256K 长上下文查询(123B 模型仅 3 个),解码速度快 28%。
主权 AI 意义
Kolibri 的"主权"体现在两个层面:
构建层面:模型在德国和芬兰的基础设施上训练,完全受欧洲和德国法律管辖,无外国控制。训练全流程(数据筛选→预训练→后训练→优化)由 Aleph Alpha 自主完成。合规框架从设计阶段就纳入了 EU AI Act、通用 AI 行为准则、GDPR 和版权法。
交付层面:模型体积足够小(78B),可以在客户自有基础设施上部署,无需将数据发送到第三方推理服务。IP 安全性得到保障。合规属性作为模型的继承属性传递给客户。
对开发者的意义
对于需要在欧洲市场部署 AI 的团队,Kolibri 提供了一个无需依赖美国或中国供应商的选项。Apache 2.0 许可证允许商业使用,Hugging Face 上可直接下载权重。
但需要注意:Kolibri 的英语综合能力(Overall EN 75.5)仍落后于 Nemotron 3 Super(80.2),在纯英语场景下不一定是最佳选择。它的核心价值在于德英双语能力、消幻觉特性和欧洲合规性——这三者的组合在市场上是唯一的。
模型权重已发布在 Hugging Face:https://huggingface.co/Aleph-Alpha/Kolibri-1
赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →