WayToClawEarn
中等影响Aleph Alpha 官方博客

Aleph Alpha 开源 Kolibri:78B 参数 3.46B 激活的德英 MoE,主权 AI 怎么选?

德国 Aleph Alpha 在统一日(10月3日)发布 Kolibri 开源模型:78.1B 总参数、3.46B 激活的德英双语 MoE,支持百万 Token 上下文,采用 Merlin-Arthur 消幻觉训练协议和精确分位数均衡路由,Apache 2.0 许可证可商用,768 块 B200 GPU 训练 21 天完成 20T Token 预训练。

Edisen Lu · WayToClawEarn来源 Aleph Alpha 官方博客发布 2026年10月4日

基于公开来源复核 · AI 辅助整理,编辑把关。 内容方法 · 原始来源

公开来源汇编

综合公开帖文/文档整理。一手主张请优先核对原始来源。

我们如何审核内容 · 一手来源 · Aleph Alpha 官方博客

核心结论

2026 年 10 月 3 日德国统一日,Aleph Alpha 发布 Kolibri 开源模型:78.1B 总参数、3.46B 激活的德英双语 MoE,Apache 2.0 许可证,支持百万 Token 上下文。这不是又一个"缩小版 GPT"——它是一个从分词器到训练协议全面原创的主权 AI 方案,在 3B 级别激活参数下打出了接近 12B 激活模型的质量。

架构与参数

Kolibri 的核心参数:

指标数值
总参数量78.1B
激活参数量3.46B(每 Token)
专家数量384 总 / 6 激活 + 1 共享专家
层数50(全部 MoE)
注意力头48 query / 4 KV
模型维度2,560
词表大小128,000
最大上下文1,000,000(1M Token)
预训练 Token 数20T(从 200T+ 原始数据处理)
知识截止英语 2024-09-01,德语 2025-08-01,综合 2026-06-18

架构上的三个关键设计选择值得关注:

384 个小专家而非少数宽专家。 Aleph Alpha 在消融实验中发现,相同总参数预算下,更多更窄的专家比更少更宽的专家表现更好。这与 Qwen3.8 的 128 专家方案不同,走的是更极致的稀疏路线。

精确分位数均衡路由。 这是 Kimi K3 估计式均衡的改进版——在固定计算开销下精确计算而非估计,且开销与批量大小无关。实际效果是更好的负载均衡和更高的模型质量。

滑动窗口注意力 + 每 5 层全注意力。 40 层使用 512 Token 窗口的滑动注意力,10 层(每 5 层一次)使用全注意力。这种混合方案在长上下文场景下兼顾效率和信息聚合。

训练细节

训练硬件和时间线:

  • GPU:768 块 NVIDIA B200
  • 预训练时长:21 天
  • 阶段 1:20T Token,16K 序列长度(21 天)
  • 阶段 2:3.44T Token 中期训练,64K 序列长度
  • 阶段 3:200B Token 长上下文适配,256K 序列长度
  • 总训练量:约 24T Token
  • 中断:21 天内 38 次非计划中断(约每 10,000 GPU 小时 1 次),全部自动恢复

后训练阶段:

  • SFT:生成 174B Token 合成数据,与开源数据集合合并为 268B Token 训练集
  • RL:120 万条精选任务,覆盖代码/数学推理、Agent 任务、指令遵循、问答、工具调用
  • 训练方法:异步训练(生成与训练并行)

预训练数据语言分布:英语约 62%,德语约 21.3%(约 4.3T Token),代码约 14%。德语数据中仅 6% 是翻译来的,其余为原生德语或改写德语。

Merlin-Arthur 消幻觉协议

Kolibri 最具创新性的设计是 Merlin-Arthur 三玩家训练博弈,专门用于降低幻觉:

  • Arthur:被训练和最终发布的模型
  • Merlin:生成能提高 Arthur 正确回答概率的上下文
  • Morgana:从上下文中剥离证据,诱导 Arthur 幻觉

训练目标:Arthur 必须学会回答 Merlin 提供的上下文,同时对 Morgana 被删减的上下文保持克制——即使猜对了也不算通过。这迫使模型真正"读懂"上下文而非猜测。

基准测试验证了这一设计。在 AA-Omniscience 非幻觉指标上,Kolibri 得分 44.0,远超 Kolibri Origin 的 14.8 和 Nemotron 3 Super 的 13.9。在 M/A Grounding Score(综合幻觉控制评分)上,Kolibri 得分 0.23,是所有对比模型中最高的。

基准表现

与同级别模型的对比(精选关键基准):

基准KolibriQwen3.6-35B-A3BNemotron 3 Super 120B-A12BMistral Small 4 119B-A6B
AIME 202596.984.691.779.8
AIME 2025(德语)87.582.985.672.3
GPQA Diamond84.383.478.074.7
LiveCodeBench v685.982.582.071.2
HumanEval+92.792.894.792.8
BFCL v461.467.261.058.0
τ²-bench telecom94.799.168.141.5
τ³-bench banking38.110.615.55.7

关键发现:Kolibri(3B 激活)在多数基准上接近甚至超过了 Nemotron 3 Super(12B 激活,120B 总参)——一个激活参数量约 4 倍的模型。但 Nemotron 3 Super 在 Overall(EN)75.5 vs 80.2、Overall(DE)70.8 vs 79.9 上仍领先。

在行业内部基准上,Kolibri 表现突出:汽车供应链 99.0,德国公共部门 75.0,半导体行业 80.4,航空航天 58.9。

双语分词器

Kolibri 使用自研的 UniBPE 分词器,结合了 BPE 的自底向上方法和 Unigram 的训练目标。在德语文本上的压缩率:4.90 bytes/token,虽然略逊于 DeepSeek V4 的 3.72 和 Gemini 的 4.13,但在德语形态学拆分上更精准。

例如 "Bundessozialgerichtes"(联邦社会法院的),Kolibri 拆分为 "Bundes|sozial|gericht|es",而竞品通常拆分为 "Bund|ess|oz|ial|gericht|es"——后者在语义层面是错误的。

四级可控推理

Kolibri 支持四种推理强度:none / low / medium / high。用户可以根据任务复杂度和成本预算选择:

  • none:无推理链,适合简单问答
  • low:轻量推理,适合标准任务
  • medium:中等推理,适合复杂分析
  • high:深度推理,适合数学证明和复杂代码

这使部署方能在同一模型上按任务灵活控制成本和延迟。

部署方式

Kolibri 可通过 vLLM 部署:

terminal
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

扩展到百万上下文:

terminal
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice \
  --max-model-len 1048576 \
  --hf-overrides '{"max_position_embeddings": 1048576}'

推荐采样参数:temperature 1.0,top_p 0.97,top_k 128。

效率数据:78B 模型在两块 H100 上可同时处理 18 个 256K 长上下文查询(123B 模型仅 3 个),解码速度快 28%。

主权 AI 意义

Kolibri 的"主权"体现在两个层面:

构建层面:模型在德国和芬兰的基础设施上训练,完全受欧洲和德国法律管辖,无外国控制。训练全流程(数据筛选→预训练→后训练→优化)由 Aleph Alpha 自主完成。合规框架从设计阶段就纳入了 EU AI Act、通用 AI 行为准则、GDPR 和版权法。

交付层面:模型体积足够小(78B),可以在客户自有基础设施上部署,无需将数据发送到第三方推理服务。IP 安全性得到保障。合规属性作为模型的继承属性传递给客户。

对开发者的意义

对于需要在欧洲市场部署 AI 的团队,Kolibri 提供了一个无需依赖美国或中国供应商的选项。Apache 2.0 许可证允许商业使用,Hugging Face 上可直接下载权重。

但需要注意:Kolibri 的英语综合能力(Overall EN 75.5)仍落后于 Nemotron 3 Super(80.2),在纯英语场景下不一定是最佳选择。它的核心价值在于德英双语能力、消幻觉特性和欧洲合规性——这三者的组合在市场上是唯一的。

模型权重已发布在 Hugging Face:https://huggingface.co/Aleph-Alpha/Kolibri-1

技术报告:https://aleph-alpha.com/downloads/tech-report.pdf

Aleph AlphaKolibri开源模型MoE主权AI德英双语Apache-2.0Merlin-Arthur

查看原文 →

仅供学习参考:案例基于公开来源整理,并可能经 AI 辅助起草、由编辑复核。不构成投资或收益建议,亦不保证结果。