Qwen3-Max-Thinking 發布說明

Qwen 已宣布 Qwen3-Max-Thinking,這是一款旗艦推理模型,旨在提供高效能的複雜推理、事實知識與代理能力。透過擴大模型參數並利用廣泛的強化學習,該模型的表現可與包括 GPT-5.2-Thinking、Claude-Opus-4.5 與 Gemini 3 Pro 在內的領先業界模型相媲美,涵蓋 19 項既定基準。

技術創新

自適應工具使用能力

Qwen3-Max-Thinking 實現了自適應工具使用,允許模型自主選擇並呼叫內建的搜尋、記憶與程式碼解譯器工具,無需使用者手動選擇。此能力是透過聚焦的訓練流程開發的,先進行工具使用的微調,之後在多樣任務上使用規則式與模型式回饋進行訓練。

  • Search and Memory: 這些工具用於減少幻覺並提供即時資訊與個人化回應的存取。
  • Code Interpreter: 這使模型能執行程式碼片段並運用計算推理解決複雜問題。

體驗累積測試時縮放

為提升推理於推斷時的效能,Qwen 為「重模式」引入了多輪測試時縮放策略。模型不再增加平行軌跡 ($N$),因為這常導致冗餘推理,而是使用「取經驗」機制來指導迭代式自我反思。

此機制從先前的輪次中萃取關鍵見解,防止模型重新推導已知結論,並專注於未解決的不確定性。此方法相較於參考原始軌跡,提供更高的上下文效率。

根據 Qwen,此策略在相似的 token 消耗下,持續優於標準的平行抽樣與聚合。觀測到的效能提升包括:

基準測試 基線 $\rightarrow$ 縮放後效能
GPQA 90.3 $\rightarrow$ 92.8
HLE 34.1 $\rightarrow$ 36.5
LiveCodeBench v6 88.0 $\rightarrow$ 91.4
IMO-AnswerBench 89.5 $\rightarrow$ 91.5
HLE (w/ tools) 55.8 $\rightarrow$ 58.3

效能基準

Qwen3-Max-Thinking 在多個關鍵面向展現出具競爭力的效能:

知識與 STEM

  • MMLU-Pro: 85.7
  • MMLU-Redux: 92.8
  • C-Eval: 93.7
  • GPQA: 87.4
  • HLE: 30.2

推理與代理程式編寫

  • LiveCodeBench v6: 85.9
  • HMMT Feb 25: 98.0
  • HMMT Nov 25: 94.7
  • IMOAnswerBench: 83.9
  • SWE Verified: 75.3

指令遵循與對齊

  • Arena-Hard v2: 90.2 (evaluated by GPT-4.1)
  • IFBench: 70.9
  • MultiChallenge: 63.3

工具使用與規劃

  • Tau² Bench: 82.1
  • BFCL-V4: 67.7
  • Deep Planning: 28.7
  • HLE (w/ tools): 49.8

可用性與整合

Qwen3-Max-Thinking 可透過 Qwen Chat (chat.qwen.ai) 以及 API (模型名稱:qwen3-max-2026-01-23) 取得。該 API 相容於 OpenAI,並支援在 extra_body 欄位中使用 enable_thinking 參數以啟用推理功能。

此外,該模型相容於 Anthropic API 協議,透過將 ANTHROPIC_BASE_URL 設定為 https://dashscope.aliyuncs.com/apps/anthropic,即可與 Claude Code 一同使用。

Sources