Aleph Alpha Kolibri 1: 독일의 주권형 78B MoE LLM (독일어 및 영어 지원)
요약 (TL;DR)
Kolibri 1은 2026년 10월 3일 Apache 2.0 라이선스로 출시된 780억 개의 파라미터를 가진 전문가 혼합(MoE) LLM입니다. 독일어와 영어에 최적화되어 있으며, 100만 토큰의 컨텍스트 윈도우를 제공합니다. 전체 78B 모델의 메모리를 요구하면서도 35억 개의 파라미터 모델 수준으로 연산하도록 설계되었습니다. 이 모델은 전적으로 유럽 인프라를 기반으로 구축되었으며, EU AI 법을 준수합니다. 데이터 프라이버시와 제어권이 가장 중요한 온프레미스 및 주권형 사용 사례를 위해 설계되었습니다.
Kolibri 1이란?
| 특징 | 상세 내용 |
|---|---|
| 총 파라미터 | 781억 개 |
| 토큰당 활성 파라미터 | 34억 6천만 개 (전체의 약 4.4%) |
| 언어 | 독일어, 영어 |
| 컨텍스트 길이 | 기본 262k 토큰; 최대 100만 토큰까지 검증됨 |
| 라이선스 | 가중치 및 설정에 대해 Apache 2.0 (학습 코드는 비공개) |
| 메모리 점유율 | 약 78GB (FP8) |
| 추론 수준 | none, low, medium, high |
| 도구 호출(Tool calling) | 지원 |
| 지식 차단 시점 | 2026년 6월 18일 |
| 학습 데이터 | 768개의 NVIDIA B200 GPU에서 약 24조 토큰 (독일어 약 20%) 학습 |
주권적 주장 – Aleph Alpha는 "주권적"이라는 용어를 두 가지 방식으로 정의합니다. (1) 모델이 EU 법률에 따라 독일/핀란드 하드웨어에서 구축, 학습 및 호스팅되었으며 외부의 통제를 받지 않음, (2) 고객에게 제한 없는 배포 권한과 IP 안전성을 제공하여 외부 종속 없이 온프레미스 사용이 가능함.
핵심 기술 혁신
1. 레이어당 384개의 전문가, 토큰당 6개 활성화 방식의 전문가 혼합(MoE)
- 50개 레이어 × 384개 전문가 + 1개 공유 전문가.
- 라우터가 토큰당 6개의 전문가를 활성화하여, 전체 78B 모델을 메모리에 유지하면서도 연산량은 약 35억 파라미터 수준으로 감소시킴.
"Kolibri는 35억 파라미터 모델처럼 연산하지만 780억 파라미터 모델의 메모리가 필요합니다."
2. 독일어 복합어에 최적화된 UniBPE 토크나이저
- 어휘 크기: 128k 토큰.
- 독일어 단어 형성 방식을 존중하는 수정된 BPE 점수 규칙(Unigram 목표) 사용.
- 경험적 토큰 수 감소: 독일 기본법(Basic Law) 기준 GPT-5의
o200k_base대비 15% 적은 토큰 사용 (41,482개 대비 35,190개)."토큰이 적다는 것은 동일한 독일어 텍스트를 읽거나 쓰는 데 필요한 단계가 줄어들고, 동일한 컨텍스트 윈도우에 더 많은 독일어를 담을 수 있음을 의미합니다."
3. 긴 컨텍스트를 위한 슬라이딩 윈도우 어텐션
- 50개 레이어 중 40개 레이어는 512토큰 슬라이딩 윈도우 어텐션을 사용하며, 5번째 레이어마다 전체 어텐션을 사용함.
- 회전 위치 임베딩(Rotary position embeddings)은 슬라이딩 윈도우 레이어에만 적용되어, 추가적인 위치 기법 없이도 262k 학습 윈도우를 넘어서는 컨텍스트 길이를 허용함.
- 최대 100만 토큰까지 검증됨; RULER 벤치마크에서 Kolibri는 63.2점을 기록하여 Qwen 3.5 35B-A3B의 57.5점을 상회함.
4. 독일어 네이티브 추론
- 약 80만 개의 독일어 추론 예제로 학습됨.
- 독일어 수학 성능: AIME 2025(독일어)에서 87.5% 기록 – 약 35억 활성 파라미터 모델 중 최고 수준이며, NVIDIA Nemotron 3 Nano(84.4%)를 능가함.
5. "모른다"는 답변을 위한 Merlin-Arthur 프로토콜
- 3자 게임(Arthur, Merlin, Morgana)을 통해 모델이 증거가 있을 때만 답변하고 그렇지 않으면 답변을 거부하도록 강제함.
- Omniscience 테스트에서 Kolibri는 44%의 확률로 모른다고 답변했으며, 이는 Qwen 3.5 35B-A3B(11%) 및 GPT-OSS 120B(23.7%)와 비교됨.
6. 조정 가능한 추론 노력
- API 파라미터
reasoning_effort(none,low,medium,high)를 통해 동일한 모델이 요청별로 지연 시간과 깊이를 조절할 수 있음.
동급 오픈 가중치 모델 대비 강점
| 지표 (활성 약 35억) | Kolibri 1 | 가장 가까운 경쟁 모델 |
|---|---|---|
| 전체 영어 점수 | 75.5 | 74.7 (Qwen 3.5 35B-A3B) |
| 전체 독일어 점수 | 70.8 | 69.8 (Qwen 3.5 35B-A3B) |
| AIME 2025 영어 | 96.9 | 89.6 (Nemotron 3 Nano) |
| AIME 2025 독일어 | 87.5 | 84.4 (Nemotron 3 Nano) |
| 미공개 기업 문서 QA (영어) | 89.7 | 87.0 (Qwen 3.5 35B-A3B) |
| 100만 토큰 컨텍스트 (기본) | 63.2 | 58.5 (Nemotron 3 Nano) |
이 모델의 가장 큰 장점은 독일어 효율성입니다. 토크나이저, 긴 컨텍스트 처리, 독일어 네이티브 추론이 결합되어 독일어로 작성된 법률, 규제 및 기술 문서에서 확실한 우위를 점합니다.
약점 및 트레이드오프
- 폐쇄형 지식(Closed-book knowledge) – RAG 벤치마크에서 12개 평가 모델 중 최하위(51.0%); Omniscience 질문에서 14.8% 정답률 기록.
- 도구 호출 – 다중 턴 성능(39.8)이 GLM-4.7 Flash(58.2) 및 Qwen 3.5 35B-A3B(54.0)보다 뒤처짐.
- 코딩 – Terminal-Bench 2.1에서 27.7점을 기록하여 Qwen 3.5 35B-A3B(39.7)보다 훨씬 낮음.
- 중간 범위 컨텍스트 – 128k 토큰에서 Kolibri는 67.9점을 기록하여 Qwen 3.5의 89.9점보다 낮음; 매우 긴 윈도우에서만 장점이 나타남.
- 하드웨어 요구 사항 – 약 78GB VRAM; 최소 2개의 80GB GPU(A100/H100) 또는 1개의 H200/B200/B300 필요.
- 생태계 성숙도 – Aleph Alpha의 커스텀 vLLM 플러그인 필요(출시 시점에 vLLM 0.29만 지원); 아직 호스팅된 추론 제공업체 없음.
- 언어 범위 – 설계상 독일어와 영어로 제한됨.
- 밀집 모델 경쟁 – Qwen 3.8 27B(밀집 모델)가 표준 영어/독일어 벤치마크에서 Kolibri를 능가하며, 토큰당 활성 파라미터는 약 8배 더 많이 사용함.
Kolibri 1 실행하기
# Aleph Alpha의 추론 플러그인 설치 (필수 vLLM 버전 포함)
pip install 'aleph-alpha-inference>=1'
# FP8 KV 캐시로 서비스; 도구 호출 및 추론 파서 활성화
vllm serve Aleph-Alpha/Kolibri-1 \
--kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice
서버는 OpenAI 호환 엔드포인트를 제공합니다. Python 클라이언트 예시:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
model="Aleph-Alpha/Kolibri-1",
messages=[{"role": "user", "content": "Erkläre kurz, was ein Mixture-of-Experts‑Modell ist."}],
extra_body={"chat_template_kwargs": {"reasoning_effort": "high", "enable_thinking": True}},
temperature=1.0, top_p=0.97, top_k=128,
)
print(resp.choices[0].message.content)
100만 토큰 컨텍스트를 사용하려면 다음을 추가하세요:
vllm serve Aleph-Alpha/Kolibri-1 \
--kv-cache-dtype fp8 \
--max-model-len 1048576 \
--hf-overrides '{"max_position_embeddings": 1048576}'
이상적인 사용 사례
- 독일 중심 기업 – 데이터를 온프레미스에 유지해야 하며 고품질 독일어 출력이 필요한 은행, 자동차 부품 업체, 항공우주 기업 또는 공공 기관.
- 긴 문서 RAG – 100만 토큰 컨텍스트와 토큰 효율적인 독일어 토크나이저가 지연 시간과 비용을 줄여주는 법률 조항, 계약서, 매뉴얼 또는 의료 지침.
- 안전 필수 애플리케이션 – 임상 의사 결정 지원이나 규제 준수 확인과 같이 환각보다 "모른다"는 답변이 선호되는 시나리오.
- 주권형 AI 전략 – 완전한 배포 자유와 IP 보호를 갖춘 EU 법률 준수 모델을 찾는 조직.
Kolibri를 선택하지 말아야 할 때
- 강력한 폐쇄형 지식 퀴즈나 코딩 지원이 필요한 프로젝트.
- 독일어/영어 이외의 다국어 작업.
- 78GB 이상의 GPU 메모리에 접근할 수 없는 환경.
- 다중 턴 도구 호출에 크게 의존하거나 중간 범위 컨텍스트 성능이 최우선인 애플리케이션.
커뮤니티 반응 하이라이트
"현재 주권형 AI 모델이 잘해야 하는 가장 중요한 점은 다른 모델의 결과를 감사하는 것이라고 생각합니다." – niemandhier
"활성 파라미터 수가 적은(6B) 또 다른 MoE 모델인 Qwen3.8 Flash와의 비교가 전혀 없다는 점이 꽤 놀랍습니다." – spijdar
"이 분야에서 공공재를 보는 것은 좋은 일입니다." – veryfancy
"더 큰 밀집 모델이 이 모델을 이깁니다. Qwen3.8 27B... 어떻게 27B 밀집 모델이 78B MoE보다 더 클 수 있죠?" – woadwarrior01
이러한 댓글들은 규제 산업을 위한 주권적이고 감사 가능한 모델의 전략적 가치와, Kolibri의 트레이드오프를 완전히 평가하기 위해 더 광범위한 벤치마크 비교(특히 최신 밀집 모델과의 비교)가 필요하다는 점을 강조합니다.
결론
Kolibri 1은 유럽에서 구축된 오픈 가중치 MoE 모델이 전문가 라우팅을 통해 연산 비용을 낮게 유지하면서도 최첨단 독일어 성능을 제공할 수 있음을 보여줍니다. 이 모델의 강점은 긴 컨텍스트 독일어 RAG, 정직한 답변 거부, 그리고 주권적 배포에 있습니다. 높은 메모리 요구 사항, 제한된 언어 지원, 약한 폐쇄형 지식은 이 모델이 데이터 주권과 독일어 중심 워크로드를 원시적인 범용성이나 코딩 능력보다 우선시하는 조직을 위한 틈새 솔루션임을 의미합니다.
Sources
관련
- Dispatch
- 프로젝트
- Dispatch
- Dispatch
- Dispatch