Qwen3 发布说明:混合思考与多语言 MoE 模型

Qwen3 引入了一种混合推理架构,允许用户在用于复杂问题求解的深度“思考模式”和用于快速响应的“非思考模式”之间切换。旗舰模型 Qwen3-235B-A22B 旨在与 DeepSeek-R1、o1、o3-mini、Grok-3 和 Gemini-2.5-Pro 等顶级模型在编码、数学和通用能力方面竞争。

模型阵容与架构

Qwen3 以 Mixture-of-Experts(MoE)模型和稠密模型两种形式提供,遵循 Apache 2.0 许可证。MoE 模型旨在提升效率,基础模型在使用仅 10% 活跃参数的情况下,性能可与 Qwen2.5 稠密模型相当。

MoE 模型

模型 总参数 激活参数 层数 头数 (Q/KV) 上下文长度
Qwen3-235B-A22B 235B 22B 94 64 / 4 128K
Qwen3-30B-A3B 30B 3B 48 32 / 4 128K

稠密模型

模型 层数 头数 (Q/KV) 嵌入共享 上下文长度
Qwen3-32B 64 64 / 8 No 128K
Qwen3-14B 40 40 / 8 No 128K
Qwen3-8B 36 32 / 8 No 128K
Qwen3-4B 36 32 / 8 Yes 32K
Qwen3-1.7B 28 16 / 8 Yes 32K
Qwen3-0.6B 28 16 / 8 Yes 32K

混合思考与预算控制

Qwen3 实现了双模式推理方法,使计算推理预算与性能提升之间能够实现可扩展且平滑的关联。

  • Thinking Mode: 模型在给出最终答案前逐步推理,针对复杂任务进行优化。
  • Non-Thinking Mode: 模型对更简单的查询提供近乎即时的响应,在此场景下速度优先于深度。

用户可以通过聊天模板中的 enable_thinking 参数来控制此行为,或在提示中使用软切换标签如 /think/no_think,在多轮对话中动态切换模式。

预训练与数据集扩展

Qwen3 在约 36 万亿 token 上进行预训练——几乎是 Qwen2.5 使用的 18 万亿 token 的两倍——覆盖 119 种语言和方言。数据收集过程包括通过 Qwen2.5-VL 提取的网页数据和类 PDF 文档,并由 Qwen2.5 进行精炼。数学和代码的合成数据使用 Qwen2.5-Math 和 Qwen2.5-Coder 生成。

预训练分为三个阶段:

  1. S1: 在 30+ 万亿 token(4K 上下文长度)上进行基础语言技能和通用知识训练。
  2. S2: 聚焦 STEM、编码和推理任务,额外使用 5 万亿 token。
  3. S3: 使用高质量长上下文数据,将上下文长度扩展至 32K。

后训练流水线

为实现混合思考能力,Qwen3 经过了四阶段的后训练过程:

  1. Long CoT Cold Start: 在数学、编码和 STEM 领域的多样化长链式思考(CoT)数据上进行微调。
  2. Reasoning-based RL: 使用基于规则的奖励,扩展计算资源进行强化学习。
  3. Thinking Mode Fusion: 通过在长 CoT 与标准指令微调数据的混合上进行微调,融合非思考能力。
  4. General RL: 在 20+ 通用领域任务上应用强化学习,以提升指令遵循、格式化和代理能力。

代理能力与集成

Qwen3 针对工具调用进行了优化,并支持模型上下文协议(MCP)。在实现方面,Qwen 推荐使用 Qwen-Agent 框架,它简化了工具调用模板和解析器。

部署建议

  • Serving Frameworks: SGLang (>=0.4.6.post1) 或 vLLM (>=0.8.4) 用于兼容 OpenAI 的 API 端点。
  • Local Usage: Ollama、LMStudio、MLX、llama.cpp 和 KTransformers。

Sources