Qwen3-Max-Thinking 发布说明

Qwen 已宣布推出 Qwen3‑Max‑Thinking,这是一款旗舰推理模型,旨在实现高性能的复杂推理、事实知识和代理能力。通过扩展模型参数并利用大量强化学习,该模型在 19 项已建立基准上实现了与行业领先模型(包括 GPT‑5.2‑Thinking、Claude‑Opus‑4.5 和 Gemini 3 Pro)相当的表现。

技术创新

自适应工具使用能力

Qwen3‑Max‑Thinking 实现了自适应工具使用,允许模型自主选择并调用内置的 SearchMemoryCode Interpreter 工具,无需用户手动选择。该能力通过聚焦的训练过程开发:先进行工具使用的微调,然后在多样任务上使用规则式和模型式反馈进行训练。

  • Search 和 Memory: 这些工具用于降低幻觉并提供实时信息和个性化响应的访问。
  • Code Interpreter: 使模型能够执行代码片段并运用计算推理来解决复杂问题。

经验累计的测试时扩展

为提升推理时的性能,Qwen 为 “heavy mode” 引入了多轮测试时扩展策略。模型不再单纯增加并行轨迹 ($N$),因为这常导致冗余推理,而是使用 “take‑experience” 机制引导迭代自我反思。

该机制从前几轮中提炼关键洞见,防止模型重新推导已知结论,而是聚焦于未解决的不确定性。相比直接引用原始轨迹,这种方式在上下文利用率上更高。

据 Qwen 称,该策略在相似 token 消耗下始终优于标准的并行采样与聚合。观察到的性能提升包括:

基准 基线 $\rightarrow$ 扩展后性能
GPQA 90.3 $\rightarrow$ 92.8
HLE 34.1 $\rightarrow$ 36.5
LiveCodeBench v6 88.0 $\rightarrow$ 91.4
IMO-AnswerBench 89.5 $\rightarrow$ 91.5
HLE (w/ tools) 55.8 $\rightarrow$ 58.3

性能基准

Qwen3‑Max‑Thinking 在多个关键维度上展示了竞争力:

知识与 STEM

  • MMLU‑Pro: 85.7
  • MMLU‑Redux: 92.8
  • C‑Eval: 93.7
  • GPQA: 87.4
  • HLE: 30.2

推理与代理编码

  • LiveCodeBench v6: 85.9
  • HMMT Feb 25: 98.0
  • HMMT Nov 25: 94.7
  • IMOAnswerBench: 83.9
  • SWE Verified: 75.3

指令遵循与对齐

  • Arena‑Hard v2: 90.2(由 GPT‑4.1 评估)
  • IFBench: 70.9
  • MultiChallenge: 63.3

工具使用与规划

  • Tau² Bench: 82.1
  • BFCL‑V4: 67.7
  • Deep Planning: 28.7
  • HLE (w/ tools): 49.8

可用性与集成

Qwen3‑Max‑Thinking 可通过 Qwen Chat(chat.qwen.ai)以及 API(模型名称:qwen3-max-2026-01-23)获取。API 兼容 OpenAI 接口,并支持在 extra_body 字段中使用 enable_thinking 参数来激活推理能力。

此外,该模型兼容 Anthropic API 协议,可通过将 ANTHROPIC_BASE_URL 配置为 https://dashscope.aliyuncs.com/apps/anthropic 来与 Claude Code 一起使用。

Sources