Aleph Alpha Kolibri 1:德国主权 78B MoE 大语言模型(支持德语和英语)

TL;DR

Kolibri 1 是一款于 2026 年 10 月 3 日在 Apache 2.0 协议下发布的 780 亿参数混合专家(MoE)大语言模型。它针对德语和英语进行了优化,拥有 100 万 token 的上下文窗口,其设计使其在计算时仅需 35 亿参数的算力,但仍需占用完整 780 亿参数模型的内存。 该模型完全基于欧洲基础设施构建,符合《欧盟人工智能法案》,旨在用于数据隐私和控制至关重要的本地部署及主权应用场景。


Kolibri 1 概览

特性 详情
总参数量 781 亿
每 token 激活参数 34.6 亿(约占总数的 4.4%)
语言 德语、英语
上下文长度 原生 26.2 万 token;经验证最高支持 100 万 token
许可证 权重与配置采用 Apache 2.0(训练代码保持私有)
内存占用 ~78 GB (FP8)
推理级别 none(无)、low(低)、medium(中)、high(高)
工具调用 支持
知识截止日期 2026 年 6 月 18 日
训练数据 在 768 块 NVIDIA B200 GPU 上训练约 24 万亿 token(约 20% 为德语)

主权声明 – Aleph Alpha 从两个维度定义“主权”:(1) 该模型是在欧盟法律框架下,利用德国/芬兰的硬件构建、训练和托管,不受外国控制;(2) 客户拥有不受限制的部署权和知识产权安全性,能够实现无需外部锁定的本地部署。


核心技术创新

1. 混合专家架构:每层 384 个专家,每 token 激活 6 个

  • 50 层 × 384 个专家 + 1 个共享专家。
  • 路由器每 token 激活 6 个专家,将计算量降低至约 35 亿参数,但仍需 780 亿参数模型驻留内存。

    "Kolibri 的计算量相当于 35 亿参数模型,但需要 780 亿参数模型的内存。"

2. 针对德语复合词优化的 UniBPE 分词器

  • 词汇表大小:12.8 万 token。
  • 使用了改进的 BPE 评分规则(Unigram 目标),符合德语构词法。
  • 经验性 token 数量缩减:在《德国基本法》文本上,比 GPT-5 的 o200k_base 少 15% 的 token(35,190 vs 41,482 token)。

    "更少的 token 意味着阅读或编写相同的德语文本所需的步骤更少,并且在相同的上下文窗口中可以容纳更多的德语内容。"

3. 用于长上下文的滑动窗口注意力机制

  • 50 层中有 40 层使用 512 token 的滑动窗口注意力;每 5 层使用一次全注意力。
  • 旋转位置嵌入(Rotary position embeddings)仅应用于滑动窗口层,允许在不使用额外位置技巧的情况下实现超过 26.2 万训练窗口的上下文长度。
  • 经验证最高支持 100 万 token;在 RULER 基准测试中,Kolibri 得分为 63.2,而 Qwen 3.5 35B-A3B 为 57.5。

4. 德语原生推理

  • 使用约 80 万个德语推理示例进行训练。
  • 德语数学表现:在 AIME 2025(德语)上达到 87.5% —— 在约 30 亿激活参数的模型中表现最佳,超过了 NVIDIA Nemotron 3 Nano (84.4%)。

5. 用于“我不知道”行为的 Merlin-Arthur 协议

  • 三方博弈(Arthur、Merlin、Morgana)强制模型仅在有证据时回答,否则选择弃权。
  • 在全知测试(Omniscience test)中,Kolibri 有 44% 的情况表示不知道,相比之下 Qwen 3.5 35B-A3B 为 11%,GPT-OSS 120B 为 23.7%。

6. 可调节的推理努力

  • API 参数 reasoning_effort(none、low、medium、high)允许同一模型根据每个请求在延迟和深度之间进行权衡。

与同类开源权重模型的对比优势

指标 (≈3B 激活) Kolibri 1 最接近的竞争对手
整体英语得分 75.5 74.7 (Qwen 3.5 35B-A3B)
整体德语得分 70.8 69.8 (Qwen 3.5 35B-A3B)
AIME 2025 英语 96.9 89.6 (Nemotron 3 Nano)
AIME 2025 德语 87.5 84.4 (Nemotron 3 Nano)
未见过的公司文档问答 (英语) 89.7 87.0 (Qwen 3.5 35B-A3B)
1M-token 上下文 (基础) 63.2 58.5 (Nemotron 3 Nano)

该模型最大的优势在于德语语言效率:分词器、长上下文处理和德语原生推理共同使其在德语编写的法律、监管和技术文档方面具有明显优势。


弱点与权衡

  • 闭卷知识 – 在检索增强生成基准测试(RAG Benchmark)中在 12 个评估模型中排名垫底(51.0%);在全知问题上仅有 14.8% 的正确率。
  • 工具调用 – 多轮对话性能 (39.8) 落后于 GLM-4.7 Flash (58.2) 和 Qwen 3.5 35B-A3B (54.0)。
  • 编程 – 在 Terminal-Bench 2.1 上得分为 27.7,远低于 Qwen 3.5 35B-A3B (39.7)。
  • 中等范围上下文 – 在 128k token 时,Kolibri 得分为 67.9,而 Qwen 3.5 为 89.9;优势仅在极长窗口下显现。
  • 硬件需求 – ~78 GB 显存;至少需要两块 80 GB GPU (A100/H100) 或单块 H200/B200/B300。
  • 生态成熟度 – 需要 Aleph Alpha 的自定义 vLLM 插件(发布时仅支持 vLLM 0.29);目前尚无托管推理提供商。
  • 语言范围 – 设计上仅限于德语和英语。
  • 稠密模型竞争 – Qwen 3.8 27B(稠密模型)在标准英/德基准测试中表现优于 Kolibri,且每 token 使用的激活参数多约 8 倍。

运行 Kolibri 1

# 安装 Aleph Alpha 的推理插件(包含所需的 vLLM 版本)
pip install 'aleph-alpha-inference>=1'

# 使用 FP8 KV 缓存提供服务;启用工具调用和推理解析器
vllm serve Aleph-Alpha/Kolibri-1 \
  --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

服务器提供与 OpenAI 兼容的端点。Python 客户端示例:

from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
    model="Aleph-Alpha/Kolibri-1",
    messages=[{"role": "user", "content": "Erkläre kurz, was ein Mixture-of-Experts‑Modell ist."}],
    extra_body={"chat_template_kwargs": {"reasoning_effort": "high", "enable_thinking": True}},
    temperature=1.0, top_p=0.97, top_k=128,
)
print(resp.choices[0].message.content)

对于 100 万 token 的上下文,添加:

vllm serve Aleph-Alpha/Kolibri-1 \
  --kv-cache-dtype fp8 \
  --max-model-len 1048576 \
  --hf-overrides '{"max_position_embeddings": 1048576}'

理想使用场景

  • 以德语为中心的企业 – 银行、汽车供应商、航空航天公司或公共机构,必须将数据保留在本地并需要高质量的德语输出。
  • 长文档 RAG – 法律法规、合同、手册或医疗指南,其中 100 万 token 的上下文和 token 高效的德语分词器可降低延迟和成本。
  • 安全关键型应用 – 在“我不知道”比产生幻觉更可取的场景中,例如临床决策支持或监管合规检查。
  • 主权 AI 战略 – 寻求符合欧盟法律、具有完全部署自由和知识产权保护的模型的组织。

何时不应选择 Kolibri

  • 需要强大闭卷琐事问答或编程辅助的项目。
  • 德语/英语之外的多语言工作负载。
  • 无法访问 ≥78 GB GPU 显存的环境。
  • 严重依赖多轮工具调用或需要最佳中等范围上下文性能的应用。

社区反应亮点

"我认为目前主权 AI 模型需要具备的主要能力是审计其他模型的结果。" – niemandhier

"没有任何与 Qwen3.8 Flash 的对比,这很引人注目,后者是另一个具有较小(6B)激活参数的 MoE 模型。" – spijdar

"很高兴看到这个领域出现了公共产品。" – veryfancy

"一个更大的稠密模型击败了它。Qwen3.8 27B……一个 27B 的稠密模型怎么会比 78B 的 MoE 更大?" – woadwarrior01

这些评论强调了两个主题:受监管行业对主权、可审计模型的需求,以及需要更广泛的基准测试对比(特别是针对较新的稠密模型)来全面评估 Kolibri 的权衡。


总结

Kolibri 1 表明,欧洲构建的开源权重 MoE 模型可以通过专家路由在保持低计算成本的同时,提供最先进的德语语言性能。其优势在于长上下文德语 RAG、诚实的弃权机制和主权部署。该模型的高内存需求、有限的语言支持以及较弱的闭卷知识意味着它是一个利基解决方案,适用于那些优先考虑数据主权和以德语为中心的工作负载,而非原始广度或编程能力的组织。

Sources

相关

  • Dispatch
  • 项目
  • Dispatch
  • Dispatch
  • Dispatch