Qwen3-Max-Thinking 릴리스 노트

Qwen은 고성능 복합 추론, 사실 지식 및 에이전시 기능을 위해 설계된 플래그십 추론 모델인 Qwen3-Max-Thinking을 발표했습니다. 모델 파라미터를 확장하고 광범위한 강화 학습을 활용함으로써, 이 모델은 GPT-5.2-Thinking, Claude-Opus-4.5, Gemini 3 Pro 등 업계 선두 모델들과 견줄 만한 성능을 19개의 확립된 벤치마크에서 달성합니다.

기술 혁신

적응형 도구 사용 기능

Qwen3-Max-Thinking은 적응형 도구 사용을 구현하여, 모델이 사용자 수동 선택 없이 내장된 Search, Memory, Code Interpreter 도구를 자율적으로 선택하고 호출할 수 있게 합니다. 이 기능은 도구 사용을 위한 초기 파인튜닝과 규칙 기반 및 모델 기반 피드백을 모두 활용한 다양한 작업에 대한 훈련을 포함하는 집중적인 학습 과정을 통해 개발되었습니다.

  • Search and Memory: 이 도구들은 환각을 완화하고 실시간 정보와 개인화된 응답에 접근하기 위해 사용됩니다.
  • Code Interpreter: 모델이 코드 스니펫을 실행하고 계산적 추론을 적용하여 복잡한 문제를 해결할 수 있게 합니다.

경험 누적 테스트 시점 스케일링

추론 성능을 향상시키기 위해 Qwen은 "heavy mode"에 대한 다중 라운드 테스트 시점 스케일링 전략을 도입했습니다. 병렬 궤적($N$)을 늘리는 대신, 이는 종종 중복된 추론을 초래하는데, 모델은 "경험 활용" 메커니즘을 사용해 반복적인 자기 반성을 안내합니다.

이 메커니즘은 이전 라운드에서 핵심 통찰을 추출하여 모델이 이미 알려진 결론을 다시 도출하는 것을 방지하고, 미해결 불확실성에 집중하도록 합니다. 이 접근법은 원시 궤적을 참조하는 것보다 높은 컨텍스트 효율성을 제공합니다.

Qwen에 따르면, 이 전략은 유사한 토큰 소비량으로 표준 병렬 샘플링 및 집계보다 일관되게 우수한 성능을 보입니다. 관찰된 성능 향상은 다음과 같습니다:

Benchmark Baseline → Scaled Performance
GPQA 90.3 → 92.8
HLE 34.1 → 36.5
LiveCodeBench v6 88.0 → 91.4
IMO-AnswerBench 89.5 → 91.5
HLE (w/ tools) 55.8 → 58.3

성능 벤치마크

Qwen3-Max-Thinking은 여러 핵심 차원에서 경쟁력 있는 성능을 보여줍니다:

지식 및 STEM

  • MMLU-Pro: 85.7
  • MMLU-Redux: 92.8
  • C-Eval: 93.7
  • GPQA: 87.4
  • HLE: 30.2

추론 및 에이전트 코딩

  • LiveCodeBench v6: 85.9
  • HMMT Feb 25: 98.0
  • HMMT Nov 25: 94.7
  • IMOAnswerBench: 83.9
  • SWE Verified: 75.3

지시 따르기 및 정렬

  • Arena-Hard v2: 90.2 (GPT-4.1 평가)
  • IFBench: 70.9
  • MultiChallenge: 63.3

도구 사용 및 계획

  • Tau² Bench: 82.1
  • BFCL-V4: 67.7
  • Deep Planning: 28.7
  • HLE (w/ tools): 49.8

가용성 및 통합

Qwen3-Max-Thinking은 Qwen Chat (chat.qwen.ai) 및 API(모델 이름: qwen3-max-2026-01-23)를 통해 제공됩니다. API는 OpenAI와 호환되며, extra_body 필드의 enable_thinking 매개변수를 지원하여 추론 기능을 활성화합니다.

또한, 이 모델은 Anthropic API 프로토콜과 호환되어 ANTHROPIC_BASE_URLhttps://dashscope.aliyuncs.com/apps/anthropic로 설정함으로써 Claude Code와 함께 사용할 수 있습니다.

Sources