Qwen3 릴리즈 노트: 하이브리드 사고와 다국어 MoE 모델

Qwen3는 복잡한 문제 해결을 위한 깊은 "Thinking Mode"와 빠른 응답을 위한 "Non-Thinking Mode" 사이를 전환할 수 있는 하이브리드 추론 아키텍처를 도입합니다. 대표 모델인 Qwen3-235B-A22B는 코딩, 수학 및 일반 능력에서 DeepSeek-R1, o1, o3-mini, Grok-3, Gemini-2.5-Pro와 같은 최상위 모델들과 경쟁하도록 설계되었습니다.

모델 라인업 및 아키텍처

Qwen3는 Apache 2.0 라이선스 하에 Mixture-of-Experts (MoE) 모델과 dense 모델 모두로 제공됩니다. MoE 모델은 효율성을 위해 설계되었으며, 기본 모델은 활성 파라미터의 10%만 사용하면서 Qwen2.5 dense 모델과 유사한 성능을 달성합니다.

MoE 모델

모델 전체 파라미터 활성 파라미터 레이어 헤드 (Q/KV) 컨텍스트 길이
Qwen3-235B-A22B 235B 22B 94 64 / 4 128K
Qwen3-30B-A3B 30B 3B 48 32 / 4 128K

Dense 모델

모델 레이어 헤드 (Q/KV) 임베딩 공유 컨텍스트 길이
Qwen3-32B 64 64 / 8 No 128K
Qwen3-14B 40 40 / 8 No 128K
Qwen3-8B 36 32 / 8 No 128K
Qwen3-4B 36 32 / 8 Yes 32K
Qwen3-1.7B 28 16 / 8 Yes 32K
Qwen3-0.6B 28 16 / 8 Yes 32K

하이브리드 사고와 예산 제어

Qwen3는 추론에 이중 모드 접근 방식을 구현하여 계산 추론 예산과 성능 향상 사이의 확장 가능하고 부드러운 상관관계를 가능하게 합니다.

  • Thinking Mode: 모델은 최종 답변을 제공하기 전에 단계별로 추론하며, 복잡한 작업에 최적화되어 있습니다.
  • Non-Thinking Mode: 모델은 속도가 깊이보다 우선시되는 단순한 질의에 대해 거의 즉시 응답을 제공합니다.

사용자는 채팅 템플릿의 enable_thinking 인자를 통해 이 동작을 제어하거나, 프롬프트 내에서 /think/no_think와 같은 소프트 스위치 태그를 사용하여 다중 턴 대화 중에 모드를 동적으로 전환할 수 있습니다.

사전 학습 및 데이터셋 확장

Qwen3는 약 36조 토큰으로 사전 학습되었으며, 이는 Qwen2.5에 사용된 18조 토큰의 거의 두 배에 해당합니다. 119개의 언어와 방언을 포괄합니다. 데이터 수집 과정에는 웹 데이터와 Qwen2.5-VL을 통해 추출되고 Qwen2.5에 의해 정제된 PDF와 유사한 문서가 포함되었습니다. 수학 및 코드를 위한 합성 데이터는 Qwen2.5-Math와 Qwen2.5-Coder를 사용해 생성되었습니다.

사전 학습은 세 단계로 진행되었습니다:

  1. S1: 30조 토큰 이상(4K 컨텍스트 길이)으로 기본 언어 능력 및 일반 지식 훈련.
  2. S2: STEM, 코딩 및 추론 작업에 초점을 맞추어 추가 5조 토큰으로 훈련.
  3. S3: 고품질 장기 컨텍스트 데이터를 사용하여 컨텍스트 길이를 32K로 확장.

사후 학습 파이프라인

하이브리드 사고 능력을 달성하기 위해 Qwen3는 네 단계의 사후 학습 과정을 거쳤습니다:

  1. Long CoT Cold Start: 수학, 코딩 및 STEM 전반에 걸친 다양한 장기 사고 사슬(Long chain-of-thought) 데이터를 사용해 파인튜닝.
  2. Reasoning-based RL: 규칙 기반 보상을 사용한 강화 학습을 위해 계산 자원을 확장.
  3. Thinking Mode Fusion: 장기 CoT와 표준 instruction-tuning 데이터를 혼합해 파인튜닝함으로써 비-사고 기능을 통합.
  4. General RL: 20개 이상의 일반 도메인 작업에 RL을 적용하여 지시 수행, 포맷팅 및 에이전시 능력을 향상.

에이전시 능력 및 통합

Qwen3는 도구 호출에 최적화되어 있으며 Model Context Protocol (MCP)을 지원합니다. 구현을 위해 Qwen은 도구 호출 템플릿과 파서를 단순화하는 Qwen-Agent 프레임워크 사용을 권장합니다.

배포 권장 사항

  • Serving Frameworks: OpenAI 호환 API 엔드포인트를 위한 SGLang (>=0.4.6.post1) 또는 vLLM (>=0.8.4).
  • Local Usage: Ollama, LMStudio, MLX, llama.cpp, 및 KTransformers.

SUMMARY: Qwen은 확장 가능한 추론을 위한 하이브리드 사고 모드와 119개 언어 지원을 특징으로 하는 오픈-웨이트 모델군인 Qwen3를 출시했습니다.

TITLE: Qwen3 릴리즈 노트: 하이브리드 사고와 다국어 MoE 모델

Sources