Qwen3-Max-Thinking 發布說明
Qwen 已宣布 Qwen3-Max-Thinking,這是一款旗艦推理模型,旨在提供高效能的複雜推理、事實知識與代理能力。透過擴大模型參數並利用廣泛的強化學習,該模型的表現可與包括 GPT-5.2-Thinking、Claude-Opus-4.5 與 Gemini 3 Pro 在內的領先業界模型相媲美,涵蓋 19 項既定基準。
技術創新
自適應工具使用能力
Qwen3-Max-Thinking 實現了自適應工具使用,允許模型自主選擇並呼叫內建的搜尋、記憶與程式碼解譯器工具,無需使用者手動選擇。此能力是透過聚焦的訓練流程開發的,先進行工具使用的微調,之後在多樣任務上使用規則式與模型式回饋進行訓練。
- Search and Memory: 這些工具用於減少幻覺並提供即時資訊與個人化回應的存取。
- Code Interpreter: 這使模型能執行程式碼片段並運用計算推理解決複雜問題。
體驗累積測試時縮放
為提升推理於推斷時的效能,Qwen 為「重模式」引入了多輪測試時縮放策略。模型不再增加平行軌跡 ($N$),因為這常導致冗餘推理,而是使用「取經驗」機制來指導迭代式自我反思。
此機制從先前的輪次中萃取關鍵見解,防止模型重新推導已知結論,並專注於未解決的不確定性。此方法相較於參考原始軌跡,提供更高的上下文效率。
根據 Qwen,此策略在相似的 token 消耗下,持續優於標準的平行抽樣與聚合。觀測到的效能提升包括:
| 基準測試 | 基線 $\rightarrow$ 縮放後效能 |
|---|---|
| GPQA | 90.3 $\rightarrow$ 92.8 |
| HLE | 34.1 $\rightarrow$ 36.5 |
| LiveCodeBench v6 | 88.0 $\rightarrow$ 91.4 |
| IMO-AnswerBench | 89.5 $\rightarrow$ 91.5 |
| HLE (w/ tools) | 55.8 $\rightarrow$ 58.3 |
效能基準
Qwen3-Max-Thinking 在多個關鍵面向展現出具競爭力的效能:
知識與 STEM
- MMLU-Pro: 85.7
- MMLU-Redux: 92.8
- C-Eval: 93.7
- GPQA: 87.4
- HLE: 30.2
推理與代理程式編寫
- LiveCodeBench v6: 85.9
- HMMT Feb 25: 98.0
- HMMT Nov 25: 94.7
- IMOAnswerBench: 83.9
- SWE Verified: 75.3
指令遵循與對齊
- Arena-Hard v2: 90.2 (evaluated by GPT-4.1)
- IFBench: 70.9
- MultiChallenge: 63.3
工具使用與規劃
- Tau² Bench: 82.1
- BFCL-V4: 67.7
- Deep Planning: 28.7
- HLE (w/ tools): 49.8
可用性與整合
Qwen3-Max-Thinking 可透過 Qwen Chat (chat.qwen.ai) 以及 API (模型名稱:qwen3-max-2026-01-23) 取得。該 API 相容於 OpenAI,並支援在 extra_body 欄位中使用 enable_thinking 參數以啟用推理功能。
此外,該模型相容於 Anthropic API 協議,透過將 ANTHROPIC_BASE_URL 設定為 https://dashscope.aliyuncs.com/apps/anthropic,即可與 Claude Code 一同使用。