Qwen3 发布说明:混合思考与多语言 MoE 模型
Qwen3 引入了一种混合推理架构,允许用户在用于复杂问题求解的深度“思考模式”和用于快速响应的“非思考模式”之间切换。旗舰模型 Qwen3-235B-A22B 旨在与 DeepSeek-R1、o1、o3-mini、Grok-3 和 Gemini-2.5-Pro 等顶级模型在编码、数学和通用能力方面竞争。
模型阵容与架构
Qwen3 以 Mixture-of-Experts(MoE)模型和稠密模型两种形式提供,遵循 Apache 2.0 许可证。MoE 模型旨在提升效率,基础模型在使用仅 10% 活跃参数的情况下,性能可与 Qwen2.5 稠密模型相当。
MoE 模型
| 模型 | 总参数 | 激活参数 | 层数 | 头数 (Q/KV) | 上下文长度 |
|---|---|---|---|---|---|
| Qwen3-235B-A22B | 235B | 22B | 94 | 64 / 4 | 128K |
| Qwen3-30B-A3B | 30B | 3B | 48 | 32 / 4 | 128K |
稠密模型
| 模型 | 层数 | 头数 (Q/KV) | 嵌入共享 | 上下文长度 |
|---|---|---|---|---|
| Qwen3-32B | 64 | 64 / 8 | No | 128K |
| Qwen3-14B | 40 | 40 / 8 | No | 128K |
| Qwen3-8B | 36 | 32 / 8 | No | 128K |
| Qwen3-4B | 36 | 32 / 8 | Yes | 32K |
| Qwen3-1.7B | 28 | 16 / 8 | Yes | 32K |
| Qwen3-0.6B | 28 | 16 / 8 | Yes | 32K |
混合思考与预算控制
Qwen3 实现了双模式推理方法,使计算推理预算与性能提升之间能够实现可扩展且平滑的关联。
- Thinking Mode: 模型在给出最终答案前逐步推理,针对复杂任务进行优化。
- Non-Thinking Mode: 模型对更简单的查询提供近乎即时的响应,在此场景下速度优先于深度。
用户可以通过聊天模板中的 enable_thinking 参数来控制此行为,或在提示中使用软切换标签如 /think 和 /no_think,在多轮对话中动态切换模式。
预训练与数据集扩展
Qwen3 在约 36 万亿 token 上进行预训练——几乎是 Qwen2.5 使用的 18 万亿 token 的两倍——覆盖 119 种语言和方言。数据收集过程包括通过 Qwen2.5-VL 提取的网页数据和类 PDF 文档,并由 Qwen2.5 进行精炼。数学和代码的合成数据使用 Qwen2.5-Math 和 Qwen2.5-Coder 生成。
预训练分为三个阶段:
- S1: 在 30+ 万亿 token(4K 上下文长度)上进行基础语言技能和通用知识训练。
- S2: 聚焦 STEM、编码和推理任务,额外使用 5 万亿 token。
- S3: 使用高质量长上下文数据,将上下文长度扩展至 32K。
后训练流水线
为实现混合思考能力,Qwen3 经过了四阶段的后训练过程:
- Long CoT Cold Start: 在数学、编码和 STEM 领域的多样化长链式思考(CoT)数据上进行微调。
- Reasoning-based RL: 使用基于规则的奖励,扩展计算资源进行强化学习。
- Thinking Mode Fusion: 通过在长 CoT 与标准指令微调数据的混合上进行微调,融合非思考能力。
- General RL: 在 20+ 通用领域任务上应用强化学习,以提升指令遵循、格式化和代理能力。
代理能力与集成
Qwen3 针对工具调用进行了优化,并支持模型上下文协议(MCP)。在实现方面,Qwen 推荐使用 Qwen-Agent 框架,它简化了工具调用模板和解析器。
部署建议
- Serving Frameworks: SGLang (
>=0.4.6.post1) 或 vLLM (>=0.8.4) 用于兼容 OpenAI 的 API 端点。 - Local Usage: Ollama、LMStudio、MLX、llama.cpp 和 KTransformers。
Sources
- OriginalQwen3: Think Deeper, Act Faster