Aleph Alpha Kolibri 1:德国主权 78B MoE 大语言模型(支持德语和英语)
TL;DR
Kolibri 1 是一款于 2026 年 10 月 3 日在 Apache 2.0 协议下发布的 780 亿参数混合专家(MoE)大语言模型。它针对德语和英语进行了优化,拥有 100 万 token 的上下文窗口,其设计使其在计算时仅需 35 亿参数的算力,但仍需占用完整 780 亿参数模型的内存。 该模型完全基于欧洲基础设施构建,符合《欧盟人工智能法案》,旨在用于数据隐私和控制至关重要的本地部署及主权应用场景。
Kolibri 1 概览
| 特性 | 详情 |
|---|---|
| 总参数量 | 781 亿 |
| 每 token 激活参数 | 34.6 亿(约占总数的 4.4%) |
| 语言 | 德语、英语 |
| 上下文长度 | 原生 26.2 万 token;经验证最高支持 100 万 token |
| 许可证 | 权重与配置采用 Apache 2.0(训练代码保持私有) |
| 内存占用 | ~78 GB (FP8) |
| 推理级别 | none(无)、low(低)、medium(中)、high(高) |
| 工具调用 | 支持 |
| 知识截止日期 | 2026 年 6 月 18 日 |
| 训练数据 | 在 768 块 NVIDIA B200 GPU 上训练约 24 万亿 token(约 20% 为德语) |
主权声明 – Aleph Alpha 从两个维度定义“主权”:(1) 该模型是在欧盟法律框架下,利用德国/芬兰的硬件构建、训练和托管,不受外国控制;(2) 客户拥有不受限制的部署权和知识产权安全性,能够实现无需外部锁定的本地部署。
核心技术创新
1. 混合专家架构:每层 384 个专家,每 token 激活 6 个
- 50 层 × 384 个专家 + 1 个共享专家。
- 路由器每 token 激活 6 个专家,将计算量降低至约 35 亿参数,但仍需 780 亿参数模型驻留内存。
"Kolibri 的计算量相当于 35 亿参数模型,但需要 780 亿参数模型的内存。"
2. 针对德语复合词优化的 UniBPE 分词器
- 词汇表大小:12.8 万 token。
- 使用了改进的 BPE 评分规则(Unigram 目标),符合德语构词法。
- 经验性 token 数量缩减:在《德国基本法》文本上,比 GPT-5 的
o200k_base少 15% 的 token(35,190 vs 41,482 token)。"更少的 token 意味着阅读或编写相同的德语文本所需的步骤更少,并且在相同的上下文窗口中可以容纳更多的德语内容。"
3. 用于长上下文的滑动窗口注意力机制
- 50 层中有 40 层使用 512 token 的滑动窗口注意力;每 5 层使用一次全注意力。
- 旋转位置嵌入(Rotary position embeddings)仅应用于滑动窗口层,允许在不使用额外位置技巧的情况下实现超过 26.2 万训练窗口的上下文长度。
- 经验证最高支持 100 万 token;在 RULER 基准测试中,Kolibri 得分为 63.2,而 Qwen 3.5 35B-A3B 为 57.5。
4. 德语原生推理
- 使用约 80 万个德语推理示例进行训练。
- 德语数学表现:在 AIME 2025(德语)上达到 87.5% —— 在约 30 亿激活参数的模型中表现最佳,超过了 NVIDIA Nemotron 3 Nano (84.4%)。
5. 用于“我不知道”行为的 Merlin-Arthur 协议
- 三方博弈(Arthur、Merlin、Morgana)强制模型仅在有证据时回答,否则选择弃权。
- 在全知测试(Omniscience test)中,Kolibri 有 44% 的情况表示不知道,相比之下 Qwen 3.5 35B-A3B 为 11%,GPT-OSS 120B 为 23.7%。
6. 可调节的推理努力
- API 参数
reasoning_effort(none、low、medium、high)允许同一模型根据每个请求在延迟和深度之间进行权衡。
与同类开源权重模型的对比优势
| 指标 (≈3B 激活) | Kolibri 1 | 最接近的竞争对手 |
|---|---|---|
| 整体英语得分 | 75.5 | 74.7 (Qwen 3.5 35B-A3B) |
| 整体德语得分 | 70.8 | 69.8 (Qwen 3.5 35B-A3B) |
| AIME 2025 英语 | 96.9 | 89.6 (Nemotron 3 Nano) |
| AIME 2025 德语 | 87.5 | 84.4 (Nemotron 3 Nano) |
| 未见过的公司文档问答 (英语) | 89.7 | 87.0 (Qwen 3.5 35B-A3B) |
| 1M-token 上下文 (基础) | 63.2 | 58.5 (Nemotron 3 Nano) |
该模型最大的优势在于德语语言效率:分词器、长上下文处理和德语原生推理共同使其在德语编写的法律、监管和技术文档方面具有明显优势。
弱点与权衡
- 闭卷知识 – 在检索增强生成基准测试(RAG Benchmark)中在 12 个评估模型中排名垫底(51.0%);在全知问题上仅有 14.8% 的正确率。
- 工具调用 – 多轮对话性能 (39.8) 落后于 GLM-4.7 Flash (58.2) 和 Qwen 3.5 35B-A3B (54.0)。
- 编程 – 在 Terminal-Bench 2.1 上得分为 27.7,远低于 Qwen 3.5 35B-A3B (39.7)。
- 中等范围上下文 – 在 128k token 时,Kolibri 得分为 67.9,而 Qwen 3.5 为 89.9;优势仅在极长窗口下显现。
- 硬件需求 – ~78 GB 显存;至少需要两块 80 GB GPU (A100/H100) 或单块 H200/B200/B300。
- 生态成熟度 – 需要 Aleph Alpha 的自定义 vLLM 插件(发布时仅支持 vLLM 0.29);目前尚无托管推理提供商。
- 语言范围 – 设计上仅限于德语和英语。
- 稠密模型竞争 – Qwen 3.8 27B(稠密模型)在标准英/德基准测试中表现优于 Kolibri,且每 token 使用的激活参数多约 8 倍。
运行 Kolibri 1
# 安装 Aleph Alpha 的推理插件(包含所需的 vLLM 版本)
pip install 'aleph-alpha-inference>=1'
# 使用 FP8 KV 缓存提供服务;启用工具调用和推理解析器
vllm serve Aleph-Alpha/Kolibri-1 \
--kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice
服务器提供与 OpenAI 兼容的端点。Python 客户端示例:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
model="Aleph-Alpha/Kolibri-1",
messages=[{"role": "user", "content": "Erkläre kurz, was ein Mixture-of-Experts‑Modell ist."}],
extra_body={"chat_template_kwargs": {"reasoning_effort": "high", "enable_thinking": True}},
temperature=1.0, top_p=0.97, top_k=128,
)
print(resp.choices[0].message.content)
对于 100 万 token 的上下文,添加:
vllm serve Aleph-Alpha/Kolibri-1 \
--kv-cache-dtype fp8 \
--max-model-len 1048576 \
--hf-overrides '{"max_position_embeddings": 1048576}'
理想使用场景
- 以德语为中心的企业 – 银行、汽车供应商、航空航天公司或公共机构,必须将数据保留在本地并需要高质量的德语输出。
- 长文档 RAG – 法律法规、合同、手册或医疗指南,其中 100 万 token 的上下文和 token 高效的德语分词器可降低延迟和成本。
- 安全关键型应用 – 在“我不知道”比产生幻觉更可取的场景中,例如临床决策支持或监管合规检查。
- 主权 AI 战略 – 寻求符合欧盟法律、具有完全部署自由和知识产权保护的模型的组织。
何时不应选择 Kolibri
- 需要强大闭卷琐事问答或编程辅助的项目。
- 德语/英语之外的多语言工作负载。
- 无法访问 ≥78 GB GPU 显存的环境。
- 严重依赖多轮工具调用或需要最佳中等范围上下文性能的应用。
社区反应亮点
"我认为目前主权 AI 模型需要具备的主要能力是审计其他模型的结果。" – niemandhier
"没有任何与 Qwen3.8 Flash 的对比,这很引人注目,后者是另一个具有较小(6B)激活参数的 MoE 模型。" – spijdar
"很高兴看到这个领域出现了公共产品。" – veryfancy
"一个更大的稠密模型击败了它。Qwen3.8 27B……一个 27B 的稠密模型怎么会比 78B 的 MoE 更大?" – woadwarrior01
这些评论强调了两个主题:受监管行业对主权、可审计模型的需求,以及需要更广泛的基准测试对比(特别是针对较新的稠密模型)来全面评估 Kolibri 的权衡。
总结
Kolibri 1 表明,欧洲构建的开源权重 MoE 模型可以通过专家路由在保持低计算成本的同时,提供最先进的德语语言性能。其优势在于长上下文德语 RAG、诚实的弃权机制和主权部署。该模型的高内存需求、有限的语言支持以及较弱的闭卷知识意味着它是一个利基解决方案,适用于那些优先考虑数据主权和以德语为中心的工作负载,而非原始广度或编程能力的组织。
Sources
相关
- Dispatch
- 项目
- Dispatch
- Dispatch
- Dispatch