Qwen3-Max-Thinking 릴리스 노트
Qwen은 고성능 복합 추론, 사실 지식 및 에이전시 기능을 위해 설계된 플래그십 추론 모델인 Qwen3-Max-Thinking을 발표했습니다. 모델 파라미터를 확장하고 광범위한 강화 학습을 활용함으로써, 이 모델은 GPT-5.2-Thinking, Claude-Opus-4.5, Gemini 3 Pro 등 업계 선두 모델들과 견줄 만한 성능을 19개의 확립된 벤치마크에서 달성합니다.
기술 혁신
적응형 도구 사용 기능
Qwen3-Max-Thinking은 적응형 도구 사용을 구현하여, 모델이 사용자 수동 선택 없이 내장된 Search, Memory, Code Interpreter 도구를 자율적으로 선택하고 호출할 수 있게 합니다. 이 기능은 도구 사용을 위한 초기 파인튜닝과 규칙 기반 및 모델 기반 피드백을 모두 활용한 다양한 작업에 대한 훈련을 포함하는 집중적인 학습 과정을 통해 개발되었습니다.
- Search and Memory: 이 도구들은 환각을 완화하고 실시간 정보와 개인화된 응답에 접근하기 위해 사용됩니다.
- Code Interpreter: 모델이 코드 스니펫을 실행하고 계산적 추론을 적용하여 복잡한 문제를 해결할 수 있게 합니다.
경험 누적 테스트 시점 스케일링
추론 성능을 향상시키기 위해 Qwen은 "heavy mode"에 대한 다중 라운드 테스트 시점 스케일링 전략을 도입했습니다. 병렬 궤적($N$)을 늘리는 대신, 이는 종종 중복된 추론을 초래하는데, 모델은 "경험 활용" 메커니즘을 사용해 반복적인 자기 반성을 안내합니다.
이 메커니즘은 이전 라운드에서 핵심 통찰을 추출하여 모델이 이미 알려진 결론을 다시 도출하는 것을 방지하고, 미해결 불확실성에 집중하도록 합니다. 이 접근법은 원시 궤적을 참조하는 것보다 높은 컨텍스트 효율성을 제공합니다.
Qwen에 따르면, 이 전략은 유사한 토큰 소비량으로 표준 병렬 샘플링 및 집계보다 일관되게 우수한 성능을 보입니다. 관찰된 성능 향상은 다음과 같습니다:
| Benchmark | Baseline → Scaled Performance |
|---|---|
| GPQA | 90.3 → 92.8 |
| HLE | 34.1 → 36.5 |
| LiveCodeBench v6 | 88.0 → 91.4 |
| IMO-AnswerBench | 89.5 → 91.5 |
| HLE (w/ tools) | 55.8 → 58.3 |
성능 벤치마크
Qwen3-Max-Thinking은 여러 핵심 차원에서 경쟁력 있는 성능을 보여줍니다:
지식 및 STEM
- MMLU-Pro: 85.7
- MMLU-Redux: 92.8
- C-Eval: 93.7
- GPQA: 87.4
- HLE: 30.2
추론 및 에이전트 코딩
- LiveCodeBench v6: 85.9
- HMMT Feb 25: 98.0
- HMMT Nov 25: 94.7
- IMOAnswerBench: 83.9
- SWE Verified: 75.3
지시 따르기 및 정렬
- Arena-Hard v2: 90.2 (GPT-4.1 평가)
- IFBench: 70.9
- MultiChallenge: 63.3
도구 사용 및 계획
- Tau² Bench: 82.1
- BFCL-V4: 67.7
- Deep Planning: 28.7
- HLE (w/ tools): 49.8
가용성 및 통합
Qwen3-Max-Thinking은 Qwen Chat (chat.qwen.ai) 및 API(모델 이름: qwen3-max-2026-01-23)를 통해 제공됩니다. API는 OpenAI와 호환되며, extra_body 필드의 enable_thinking 매개변수를 지원하여 추론 기능을 활성화합니다.
또한, 이 모델은 Anthropic API 프로토콜과 호환되어 ANTHROPIC_BASE_URL을 https://dashscope.aliyuncs.com/apps/anthropic로 설정함으로써 Claude Code와 함께 사용할 수 있습니다.