Aleph Alpha Kolibri 1:德國主權 78B MoE LLM,支援德語與英語
TL;DR
Kolibri 1 是一款於 2026 年 10 月 3 日在 Apache 2.0 授權下發布的 780 億參數混合專家模型 (MoE) LLM,針對德語和英語進行了優化,具備 100 萬 token 的上下文視窗,其設計使其運算量僅相當於 35 億參數模型,但仍需 780 億參數模型的記憶體容量。 它完全建立在歐洲基礎設施之上,符合歐盟《人工智慧法案》(EU AI Act),專為資料隱私與控制至關重要的地端部署與主權應用場景而設計。
Kolibri 1 是什麼
| 特性 | 詳細資訊 |
|---|---|
| 總參數 | 781 億 |
| 每個 token 的活躍參數 | 34.6 億 (約總數的 4.4%) |
| 語言 | 德語、英語 |
| 上下文長度 | 原生 262k tokens;經驗證最高可達 100 萬 tokens |
| 授權 | 權重與配置採用 Apache 2.0 (訓練程式碼仍為專有) |
| 記憶體佔用 | 約 78 GB (FP8) |
| 推理等級 | none, low, medium, high |
| 工具呼叫 | 支援 |
| 知識截止日期 | 2026 年 6 月 18 日 |
| 訓練資料 | 約 24 兆 tokens (約 20% 德語),使用 768 張 NVIDIA B200 GPU |
主權聲明 – Aleph Alpha 從兩個層面定義「主權」:(1) 該模型是在歐盟法律下,於德國/芬蘭的硬體上構建、訓練與託管,不受外國控制;(2) 客戶擁有不受限制的部署權與智慧財產權保障,實現無需外部鎖定的地端使用。
核心技術創新
1. 混合專家模型 (MoE),每層 384 個專家,每個 token 啟用 6 個
- 50 層 × 384 個專家 + 1 個共享專家。
- 路由器為每個 token 啟用 6 個專家,將運算量降低至約 35 億參數,但仍需將完整的 780 億參數模型載入記憶體。
"Kolibri 的運算量如同 35 億參數模型,但需要 780 億參數模型的記憶體。"
2. 針對德語複合詞調整的 UniBPE 分詞器
- 詞彙量:12.8 萬 tokens。
- 使用修改後的 BPE 評分規則 (Unigram 目標),符合德語構詞法。
- 經驗證的 token 數量減少:在《德國基本法》文本上,比 GPT-5 的
o200k_base少 15% 的 tokens (35,190 vs 41,482 tokens)。"更少的 tokens 意味著閱讀或編寫相同的德語文本所需的步驟更少,且相同的上下文視窗能容納更多德語內容。"
3. 用於長上下文的滑動視窗注意力機制
- 50 層中有 40 層使用 512-token 滑動視窗注意力;每 5 層使用一次全注意力。
- 旋轉位置嵌入 (Rotary position embeddings) 僅應用於滑動視窗層,允許在不使用額外位置技巧的情況下,實現超過 262k 訓練視窗的上下文長度。
- 經驗證最高可達 100 萬 tokens;在 RULER 基準測試中,Kolibri 得分為 63.2,而 Qwen 3.5 35B-A3B 為 57.5。
4. 德語原生推理
- 使用約 80 萬個德語推理範例進行訓練。
- 德語數學表現:在 AIME 2025 (德語) 上達到 87.5% – 在約 30 億活躍參數模型中表現最佳,超越了 NVIDIA Nemotron 3 Nano (84.4%)。
5. 用於「我不知道」行為的 Merlin-Arthur 協議
- 三方博弈 (Arthur, Merlin, Morgana) 強制模型僅在有證據時回答,否則拒絕回答。
- 在全知測試 (Omniscience test) 中,Kolibri 有 44% 的情況表示不知道,相比之下 Qwen 3.5 35B-A3B 為 11%,GPT-OSS 120B 為 23.7%。
6. 可調整的推理努力
- API 參數
reasoning_effort(none,low,medium,high) 允許同一模型根據每個請求在延遲與深度之間進行權衡。
與同類開放權重模型的優勢比較
| 指標 (約 30 億活躍參數) | Kolibri 1 | 最接近的競爭對手 |
|---|---|---|
| 整體英語分數 | 75.5 | 74.7 (Qwen 3.5 35B-A3B) |
| 整體德語分數 | 70.8 | 69.8 (Qwen 3.5 35B-A3B) |
| AIME 2025 英語 | 96.9 | 89.6 (Nemotron 3 Nano) |
| AIME 2025 德語 | 87.5 | 84.4 (Nemotron 3 Nano) |
| 未見過的公司文件問答 (英語) | 89.7 | 87.0 (Qwen 3.5 35B-A3B) |
| 100 萬 token 上下文 (基礎) | 63.2 | 58.5 (Nemotron 3 Nano) |
該模型最大的優勢在於德語處理效率:分詞器、長上下文處理與德語原生推理相結合,使其在德語編寫的法律、監管與技術文件中具有明顯優勢。
弱點與權衡
- 封閉式知識 – 在檢索增強生成基準測試 (RAG Benchmark) 中,在 12 個評估模型中排名墊底 (51.0%);在全知問題上僅有 14.8% 正確率。
- 工具呼叫 – 多輪對話表現 (39.8) 落後於 GLM-4.7 Flash (58.2) 與 Qwen 3.5 35B-A3B (54.0)。
- 程式編寫 – 在 Terminal-Bench 2.1 上得分 27.7,遠低於 Qwen 3.5 35B-A3B (39.7)。
- 中等長度上下文 – 在 128k tokens 時,Kolibri 得分為 67.9,而 Qwen 3.5 為 89.9;優勢僅在極長視窗下顯現。
- 硬體需求 – 約 78 GB VRAM;至少需要兩張 80 GB GPU (A100/H100) 或單張 H200/B200/B300。
- 生態系統成熟度 – 需要 Aleph Alpha 的自訂 vLLM 外掛 (發布時僅支援 vLLM 0.29);目前尚無託管推理供應商。
- 語言範圍 – 設計上僅限於德語與英語。
- 密集模型競爭 – Qwen 3.8 27B (密集模型) 在標準英/德語基準測試中表現優於 Kolibri,且每個 token 使用的活躍參數多出約 8 倍。
執行 Kolibri 1
# 安裝 Aleph Alpha 的推理外掛 (包含所需的 vLLM 版本)
pip install 'aleph-alpha-inference>=1'
# 使用 FP8 KV 快取提供服務;啟用工具呼叫與推理解析器
vllm serve Aleph-Alpha/Kolibri-1 \
--kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice
伺服器提供與 OpenAI 相容的端點。Python 客戶端範例:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
model="Aleph-Alpha/Kolibri-1",
messages=[{"role": "user", "content": "Erkläre kurz, was ein Mixture-of-Experts‑Modell ist."}],
extra_body={"chat_template_kwargs": {"reasoning_effort": "high", "enable_thinking": True}},
temperature=1.0, top_p=0.97, top_k=128,
)
print(resp.choices[0].message.content)
對於 100 萬 token 的上下文,請加入:
vllm serve Aleph-Alpha/Kolibri-1 \
--kv-cache-dtype fp8 \
--max-model-len 1048576 \
--hf-overrides '{"max_position_embeddings": 1048576}'
理想應用場景
- 以德語為中心的企業 – 銀行、汽車供應商、航太公司或公共機構,必須將資料保留在地端,並需要高品質的德語輸出。
- 長文件 RAG – 法律條文、合約、手冊或醫療指南,其中 100 萬 token 的上下文與高效的德語分詞器可降低延遲與成本。
- 安全關鍵應用 – 在「我不知道」比產生幻覺更好的場景,例如臨床決策支援或監管合規檢查。
- 主權 AI 策略 – 尋求符合歐盟法律、擁有完全部署自由與 IP 保護的模型組織。
何時不應選擇 Kolibri
- 需要強大封閉式知識問答或程式編寫協助的專案。
- 德語/英語以外的多語言工作負載。
- 無法存取 ≥78 GB GPU 記憶體的環境。
- 嚴重依賴多輪工具呼叫或需要最佳中等長度上下文表現的應用。
社群反應精選
"我認為目前主權 AI 模型需要具備的主要能力是審核其他模型的結果。" – niemandhier
"沒有與 Qwen3.8 Flash 進行任何比較,這點非常引人注目,因為後者也是一個具有較小 (6B) 活躍參數數量的 MoE 模型。" – spijdar
"很高興看到這個領域出現公共財。" – veryfancy
"一個更大的密集模型擊敗了它。Qwen3.8 27B ... 為什麼 27B 密集模型會比 78B MoE 更大?" – woadwarrior01
這些評論強調了兩個主題:主權、可審計模型對於受監管行業的戰略價值,以及需要更廣泛的基準測試比較 (特別是針對較新的密集模型) 來全面評估 Kolibri 的權衡。
總結
Kolibri 1 證明了歐洲構建的開放權重 MoE 模型可以透過專家路由在保持低運算成本的同時,提供最先進的德語表現。其優勢在於長上下文德語 RAG、誠實的拒絕回答以及主權部署。該模型的高記憶體需求、有限的語言支援以及較弱的封閉式知識,意味著它是一個利基解決方案,適合那些優先考慮資料主權與德語工作負載,而非原始廣度或程式編寫能力的組織。
Sources
相關
- Dispatch
- 專案
- Dispatch
- Dispatch
- Dispatch