Qwen3 릴리즈 노트: 하이브리드 사고와 다국어 MoE 모델
Qwen3는 복잡한 문제 해결을 위한 깊은 "Thinking Mode"와 빠른 응답을 위한 "Non-Thinking Mode" 사이를 전환할 수 있는 하이브리드 추론 아키텍처를 도입합니다. 대표 모델인 Qwen3-235B-A22B는 코딩, 수학 및 일반 능력에서 DeepSeek-R1, o1, o3-mini, Grok-3, Gemini-2.5-Pro와 같은 최상위 모델들과 경쟁하도록 설계되었습니다.
모델 라인업 및 아키텍처
Qwen3는 Apache 2.0 라이선스 하에 Mixture-of-Experts (MoE) 모델과 dense 모델 모두로 제공됩니다. MoE 모델은 효율성을 위해 설계되었으며, 기본 모델은 활성 파라미터의 10%만 사용하면서 Qwen2.5 dense 모델과 유사한 성능을 달성합니다.
MoE 모델
| 모델 | 전체 파라미터 | 활성 파라미터 | 레이어 | 헤드 (Q/KV) | 컨텍스트 길이 |
|---|---|---|---|---|---|
| Qwen3-235B-A22B | 235B | 22B | 94 | 64 / 4 | 128K |
| Qwen3-30B-A3B | 30B | 3B | 48 | 32 / 4 | 128K |
Dense 모델
| 모델 | 레이어 | 헤드 (Q/KV) | 임베딩 공유 | 컨텍스트 길이 |
|---|---|---|---|---|
| Qwen3-32B | 64 | 64 / 8 | No | 128K |
| Qwen3-14B | 40 | 40 / 8 | No | 128K |
| Qwen3-8B | 36 | 32 / 8 | No | 128K |
| Qwen3-4B | 36 | 32 / 8 | Yes | 32K |
| Qwen3-1.7B | 28 | 16 / 8 | Yes | 32K |
| Qwen3-0.6B | 28 | 16 / 8 | Yes | 32K |
하이브리드 사고와 예산 제어
Qwen3는 추론에 이중 모드 접근 방식을 구현하여 계산 추론 예산과 성능 향상 사이의 확장 가능하고 부드러운 상관관계를 가능하게 합니다.
- Thinking Mode: 모델은 최종 답변을 제공하기 전에 단계별로 추론하며, 복잡한 작업에 최적화되어 있습니다.
- Non-Thinking Mode: 모델은 속도가 깊이보다 우선시되는 단순한 질의에 대해 거의 즉시 응답을 제공합니다.
사용자는 채팅 템플릿의 enable_thinking 인자를 통해 이 동작을 제어하거나, 프롬프트 내에서 /think 및 /no_think와 같은 소프트 스위치 태그를 사용하여 다중 턴 대화 중에 모드를 동적으로 전환할 수 있습니다.
사전 학습 및 데이터셋 확장
Qwen3는 약 36조 토큰으로 사전 학습되었으며, 이는 Qwen2.5에 사용된 18조 토큰의 거의 두 배에 해당합니다. 119개의 언어와 방언을 포괄합니다. 데이터 수집 과정에는 웹 데이터와 Qwen2.5-VL을 통해 추출되고 Qwen2.5에 의해 정제된 PDF와 유사한 문서가 포함되었습니다. 수학 및 코드를 위한 합성 데이터는 Qwen2.5-Math와 Qwen2.5-Coder를 사용해 생성되었습니다.
사전 학습은 세 단계로 진행되었습니다:
- S1: 30조 토큰 이상(4K 컨텍스트 길이)으로 기본 언어 능력 및 일반 지식 훈련.
- S2: STEM, 코딩 및 추론 작업에 초점을 맞추어 추가 5조 토큰으로 훈련.
- S3: 고품질 장기 컨텍스트 데이터를 사용하여 컨텍스트 길이를 32K로 확장.
사후 학습 파이프라인
하이브리드 사고 능력을 달성하기 위해 Qwen3는 네 단계의 사후 학습 과정을 거쳤습니다:
- Long CoT Cold Start: 수학, 코딩 및 STEM 전반에 걸친 다양한 장기 사고 사슬(Long chain-of-thought) 데이터를 사용해 파인튜닝.
- Reasoning-based RL: 규칙 기반 보상을 사용한 강화 학습을 위해 계산 자원을 확장.
- Thinking Mode Fusion: 장기 CoT와 표준 instruction-tuning 데이터를 혼합해 파인튜닝함으로써 비-사고 기능을 통합.
- General RL: 20개 이상의 일반 도메인 작업에 RL을 적용하여 지시 수행, 포맷팅 및 에이전시 능력을 향상.
에이전시 능력 및 통합
Qwen3는 도구 호출에 최적화되어 있으며 Model Context Protocol (MCP)을 지원합니다. 구현을 위해 Qwen은 도구 호출 템플릿과 파서를 단순화하는 Qwen-Agent 프레임워크 사용을 권장합니다.
배포 권장 사항
- Serving Frameworks: OpenAI 호환 API 엔드포인트를 위한 SGLang (
>=0.4.6.post1) 또는 vLLM (>=0.8.4). - Local Usage: Ollama, LMStudio, MLX, llama.cpp, 및 KTransformers.
SUMMARY: Qwen은 확장 가능한 추론을 위한 하이브리드 사고 모드와 119개 언어 지원을 특징으로 하는 오픈-웨이트 모델군인 Qwen3를 출시했습니다.
TITLE: Qwen3 릴리즈 노트: 하이브리드 사고와 다국어 MoE 모델
Sources
- OriginalQwen3: Think Deeper, Act Faster