Qwen3-Max-Thinking 发布说明
Qwen 已宣布推出 Qwen3‑Max‑Thinking,这是一款旗舰推理模型,旨在实现高性能的复杂推理、事实知识和代理能力。通过扩展模型参数并利用大量强化学习,该模型在 19 项已建立基准上实现了与行业领先模型(包括 GPT‑5.2‑Thinking、Claude‑Opus‑4.5 和 Gemini 3 Pro)相当的表现。
技术创新
自适应工具使用能力
Qwen3‑Max‑Thinking 实现了自适应工具使用,允许模型自主选择并调用内置的 Search、Memory 和 Code Interpreter 工具,无需用户手动选择。该能力通过聚焦的训练过程开发:先进行工具使用的微调,然后在多样任务上使用规则式和模型式反馈进行训练。
- Search 和 Memory: 这些工具用于降低幻觉并提供实时信息和个性化响应的访问。
- Code Interpreter: 使模型能够执行代码片段并运用计算推理来解决复杂问题。
经验累计的测试时扩展
为提升推理时的性能,Qwen 为 “heavy mode” 引入了多轮测试时扩展策略。模型不再单纯增加并行轨迹 ($N$),因为这常导致冗余推理,而是使用 “take‑experience” 机制引导迭代自我反思。
该机制从前几轮中提炼关键洞见,防止模型重新推导已知结论,而是聚焦于未解决的不确定性。相比直接引用原始轨迹,这种方式在上下文利用率上更高。
据 Qwen 称,该策略在相似 token 消耗下始终优于标准的并行采样与聚合。观察到的性能提升包括:
| 基准 | 基线 $\rightarrow$ 扩展后性能 |
|---|---|
| GPQA | 90.3 $\rightarrow$ 92.8 |
| HLE | 34.1 $\rightarrow$ 36.5 |
| LiveCodeBench v6 | 88.0 $\rightarrow$ 91.4 |
| IMO-AnswerBench | 89.5 $\rightarrow$ 91.5 |
| HLE (w/ tools) | 55.8 $\rightarrow$ 58.3 |
性能基准
Qwen3‑Max‑Thinking 在多个关键维度上展示了竞争力:
知识与 STEM
- MMLU‑Pro: 85.7
- MMLU‑Redux: 92.8
- C‑Eval: 93.7
- GPQA: 87.4
- HLE: 30.2
推理与代理编码
- LiveCodeBench v6: 85.9
- HMMT Feb 25: 98.0
- HMMT Nov 25: 94.7
- IMOAnswerBench: 83.9
- SWE Verified: 75.3
指令遵循与对齐
- Arena‑Hard v2: 90.2(由 GPT‑4.1 评估)
- IFBench: 70.9
- MultiChallenge: 63.3
工具使用与规划
- Tau² Bench: 82.1
- BFCL‑V4: 67.7
- Deep Planning: 28.7
- HLE (w/ tools): 49.8
可用性与集成
Qwen3‑Max‑Thinking 可通过 Qwen Chat(chat.qwen.ai)以及 API(模型名称:qwen3-max-2026-01-23)获取。API 兼容 OpenAI 接口,并支持在 extra_body 字段中使用 enable_thinking 参数来激活推理能力。
此外,该模型兼容 Anthropic API 协议,可通过将 ANTHROPIC_BASE_URL 配置为 https://dashscope.aliyuncs.com/apps/anthropic 来与 Claude Code 一起使用。