Aleph Alpha Kolibri 1: ドイツの主権的78B MoE LLM(ドイツ語・英語対応)
TL;DR
Kolibri 1は、2026年10月3日にApache 2.0ライセンスで公開された780億パラメータのMixture-of-Experts (MoE) LLMです。ドイツ語と英語に最適化されており、100万トークンのコンテキストウィンドウを備えています。35億パラメータモデル相当の計算量で動作しつつ、メモリは780億パラメータモデル分を必要とする設計です。 完全に欧州のインフラ上で構築され、EU AI法に準拠しており、データプライバシーと制御が最優先されるオンプレミスでの主権的利用を想定しています。
Kolibri 1とは
| 特徴 | 詳細 |
|---|---|
| 総パラメータ数 | 78.1 B |
| トークンあたりのアクティブパラメータ数 | 3.46 B (全体の約4.4%) |
| 言語 | ドイツ語、英語 |
| コンテキスト長 | ネイティブ262kトークン、最大1Mトークンまで検証済み |
| ライセンス | 重みと設定はApache 2.0(学習コードはプロプライエタリ) |
| メモリフットプリント | 約78 GB (FP8) |
| 推論レベル | none, low, medium, high |
| ツール呼び出し | 対応 |
| 知識のカットオフ | 2026年6月18日 |
| 学習データ | 約24 Tトークン(ドイツ語約20%)、NVIDIA B200 GPU 768基を使用 |
主権の主張 – Aleph Alphaは「主権的」を2つの意味で定義しています。(1) モデルはEU法の下、ドイツ/フィンランドのハードウェア上で構築・学習・ホストされており、外国の管理下にないこと。(2) 顧客は無制限のデプロイ権と知的財産権の安全性を享受でき、外部のロックインなしにオンプレミスでの利用が可能であること。
主要な技術革新
1. レイヤーあたり384の専門家、トークンあたり6つがアクティブなMixture-of-Experts
- 50レイヤー × 384専門家 + 1共有専門家。
- ルーターがトークンごとに6つの専門家をアクティブ化し、計算量を約35億パラメータ相当に削減。ただし、メモリ上には780億パラメータモデル全体を保持する必要がある。
"Kolibriは35億パラメータモデルのように計算しますが、780億パラメータモデルのメモリを必要とします。"
2. ドイツ語の複合語に対応したUniBPEトークナイザー
- 語彙サイズ: 128kトークン。
- ドイツ語の単語形成を尊重する修正版BPEスコアリングルール(Unigram目的関数)を使用。
- 実証的なトークン削減量: ドイツ基本法において、GPT-5の
o200k_baseと比較して15%少ないトークン数(41,482トークンに対し35,190トークン)。"トークン数が少ないということは、同じドイツ語テキストを読み書きするステップが減り、同じコンテキストウィンドウにより多くのドイツ語が収まることを意味します。"
3. 長文コンテキストのためのスライディングウィンドウアテンション
- 50レイヤー中40レイヤーで512トークンのスライディングウィンドウアテンションを使用。5レイヤーごとにフルアテンションを使用。
- ロータリー位置埋め込みはスライディングウィンドウレイヤーのみに適用され、追加の位置情報トリックなしで262kの学習ウィンドウを超えるコンテキスト長を可能にする。
- 最大1Mトークンまで検証済み。RULERベンチマークでは、Kolibriは63.2を記録し、Qwen 3.5 35B-A3Bの57.5を上回った。
4. ドイツ語ネイティブの推論
- 約80万件のドイツ語推論例で学習。
- ドイツ語の数学性能: AIME 2025 (ドイツ語) で87.5%を記録。アクティブパラメータ数約3Bのモデルの中で最高であり、NVIDIA Nemotron 3 Nano (84.4%) を上回る。
5. 「知らない」と回答するためのMerlin-Arthurプロトコル
- 3者間ゲーム(Arthur, Merlin, Morgana)により、証拠がある場合にのみ回答し、それ以外は回答を控えるようモデルに強制。
- Omniscienceテストにおいて、Kolibriは44%の確率で「知らない」と回答。これに対し、Qwen 3.5 35B-A3Bは11%、GPT-OSS 120Bは23.7%であった。
6. 調整可能な推論努力
- APIパラメータ
reasoning_effort(none,low,medium,high) により、リクエストごとにレイテンシと深さのトレードオフを調整可能。
他のオープンウェイトモデルとの比較
| 指標 (アクティブ約3B) | Kolibri 1 | 最も近い競合 |
|---|---|---|
| 英語スコア全体 | 75.5 | 74.7 (Qwen 3.5 35B-A3B) |
| ドイツ語スコア全体 | 70.8 | 69.8 (Qwen 3.5 35B-A3B) |
| AIME 2025 英語 | 96.9 | 89.6 (Nemotron 3 Nano) |
| AIME 2025 ドイツ語 | 87.5 | 84.4 (Nemotron 3 Nano) |
| 未見の社内文書QA (英語) | 89.7 | 87.0 (Qwen 3.5 35B-A3B) |
| 1Mトークンコンテキスト (ベース) | 63.2 | 58.5 (Nemotron 3 Nano) |
このモデルの最大の利点はドイツ語の効率性です。トークナイザー、長文コンテキスト処理、ドイツ語ネイティブの推論が組み合わさることで、ドイツ語で書かれた法律、規制、技術文書において明確な優位性を発揮します。
弱点とトレードオフ
- クローズドブック知識 – Retrieval-Augmented Generation Benchmarkで評価対象12モデル中最低(51.0%)。Omniscienceの質問に対する正解率はわずか14.8%。
- ツール呼び出し – マルチターン性能(39.8)は、GLM-4.7 Flash(58.2)やQwen 3.5 35B-A3B(54.0)に劣る。
- コーディング – Terminal-Bench 2.1で27.7を記録し、Qwen 3.5 35B-A3B(39.7)を大きく下回る。
- 中程度のコンテキスト – 128kトークンにおいて、Kolibriは67.9を記録し、Qwen 3.5の89.9に及ばない。利点は非常に長いウィンドウでのみ現れる。
- ハードウェア要件 – 約78 GBのVRAM。少なくとも2基の80 GB GPU (A100/H100) または1基のH200/B200/B300が必要。
- エコシステムの成熟度 – Aleph AlphaのカスタムvLLMプラグインが必要(ローンチ時点ではvLLM 0.29のみサポート)。ホスト型推論プロバイダーはまだ存在しない。
- 言語範囲 – 設計上、ドイツ語と英語に限定されている。
- 密なモデルとの競合 – Qwen 3.8 27B(密なモデル)は、標準的な英語/ドイツ語ベンチマークでKolibriを上回る一方、トークンあたりのアクティブパラメータ数は約8倍多い。
Kolibri 1の実行
# Aleph Alphaの推論プラグインをインストール(必要なvLLMバージョンを含む)
pip install 'aleph-alpha-inference>=1'
# FP8 KVキャッシュでサーブ。ツール呼び出しと推論パーサーを有効化
vllm serve Aleph-Alpha/Kolibri-1 \
--kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice
サーバーはOpenAI互換のエンドポイントを提供します。Pythonクライアントの例:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
model="Aleph-Alpha/Kolibri-1",
messages=[{"role": "user", "content": "Erkläre kurz, was ein Mixture-of-Experts‑Modell ist."}],
extra_body={"chat_template_kwargs": {"reasoning_effort": "high", "enable_thinking": True}},
temperature=1.0, top_p=0.97, top_k=128,
)
print(resp.choices[0].message.content)
1Mトークンのコンテキストを使用する場合は、以下を追加してください:
vllm serve Aleph-Alpha/Kolibri-1 \
--kv-cache-dtype fp8 \
--max-model-len 1048576 \
--hf-overrides '{"max_position_embeddings": 1048576}'
想定されるユースケース
- ドイツ中心の企業 – データをオンプレミスに保持する必要があり、高品質なドイツ語出力を求める銀行、自動車サプライヤー、航空宇宙企業、公共機関。
- 長文ドキュメントRAG – 1Mトークンのコンテキストとトークン効率の良いドイツ語トークナイザーにより、レイテンシとコストを削減できる法律、契約書、マニュアル、医療ガイドライン。
- 安全性が重要なアプリケーション – 臨床意思決定支援や規制コンプライアンスチェックなど、ハルシネーションよりも「知らない」と答えることが好ましいシナリオ。
- 主権的AI戦略 – 完全なデプロイの自由と知的財産保護を備えた、EU法準拠のモデルを求める組織。
Kolibriを選択すべきでない場合
- クローズドブックのトリビアやコーディング支援を強く必要とするプロジェクト。
- ドイツ語/英語以外の多言語ワークロード。
- 78 GB以上のGPUメモリにアクセスできない環境。
- マルチターンのツール呼び出しに大きく依存する、または中程度のコンテキストで最高の性能を必要とするアプリケーション。
コミュニティの反応
"現時点で主権的AIモデルに求められる主な能力は、他のモデルの結果を監査することだと思います。" – niemandhier
"アクティブパラメータ数が少ない(6B)別のMoEモデルであるQwen3.8 Flashとの比較が全くないのは非常に目立ちます。" – spijdar
"この分野で公共財が見られるのは良いことです。" – veryfancy
"より大きな密なモデルが勝っている。Qwen3.8 27B... 27Bの密なモデルが78BのMoEより大きいとはどういうことか?" – woadwarrior01
これらのコメントは、規制セクターにおける主権的で監査可能なモデルの戦略的価値と、Kolibriのトレードオフを完全に評価するために(特に新しい密なモデルに対する)より広範なベンチマーク比較が必要であるという2つのテーマを強調しています。
結論
Kolibri 1は、欧州で構築されたオープンウェイトのMoEが、専門家のルーティングを通じて計算コストを低く抑えつつ、最先端のドイツ語性能を提供できることを示しています。その強みは、長文コンテキストのドイツ語RAG、誠実な回答拒否、そして主権的なデプロイメントにあります。高いメモリ要件、限定的な言語サポート、そしてクローズドブック知識の弱さは、データ主権とドイツ語中心のワークロードを、生の広範さやコーディング能力よりも優先する組織にとってのニッチなソリューションであることを意味しています。
Sources
関連
- Dispatch
- プロジェクト
- Dispatch
- Dispatch
- Dispatch