Qwen3 版本說明:混合思考與多語言 MoE 模型
Qwen3 引入了一種混合推理架構,使用者可以在針對複雜問題解決的深度「思考模式」與提供快速回應的「非思考模式」之間切換。旗艦模型 Qwen3-235B-A22B 旨在於程式碼、數學及一般能力上與 DeepSeek-R1、o1、o3-mini、Grok-3 與 Gemini-2.5-Pro 等頂級模型競爭。
模型陣容與架構
Qwen3 以 Mixture-of-Experts(MoE)與密集模型兩種形式提供,皆採用 Apache 2.0 授權。MoE 模型設計注重效率,基礎模型的效能與 Qwen2.5 密集模型相近,卻僅使用 10% 的活躍參數。
MoE 模型
| 模型 | 總參數量 | 啟用參數量 | 層數 | 頭數 (Q/KV) | 上下文長度 |
|---|---|---|---|---|---|
| Qwen3-235B-A22B | 235B | 22B | 94 | 64 / 4 | 128K |
| Qwen3-30B-A3B | 30B | 3B | 48 | 32 / 4 | 128K |
密集模型
| 模型 | 層數 | 頭數 (Q/KV) | 共享嵌入 | 上下文長度 |
|---|---|---|---|---|
| Qwen3-32B | 64 | 64 / 8 | 否 | 128K |
| Qwen3-14B | 40 | 40 / 8 | 否 | 128K |
| Qwen3-8B | 36 | 32 / 8 | 否 | 128K |
| Qwen3-4B | 36 | 32 / 8 | 是 | 32K |
| Qwen3-1.7B | 28 | 16 / 8 | 是 | 32K |
| Qwen3-0.6B | 28 | 16 / 8 | 是 | 32K |
混合思考與預算控制
Qwen3 實作了雙模式推理方法,使計算推理預算與效能提升之間能夠以可擴展且平滑的方式相關聯。
- 思考模式: 模型在給出最終答案前逐步推理,針對複雜任務進行最佳化。
- 非思考模式: 模型對較簡單的查詢提供近乎即時的回應,速度優先於深度。
使用者可透過聊天範本中的 enable_thinking 參數控制此行為,或在提示詞中使用類似 /think 與 /no_think 的軟切換標籤,在多輪對話中動態切換模式。
預訓練與資料集擴充
Qwen3 以約 36 兆個 token 進行預訓練——幾乎是 Qwen2.5 使用的 18 兆的兩倍——涵蓋 119 種語言與方言。資料收集過程包括透過 Qwen2.5-VL 擷取的網路資料與類 PDF 文件,並由 Qwen2.5 精練。數學與程式碼的合成資料則使用 Qwen2.5-Math 與 Qwen2.5-Coder 產生。
預訓練分為三個階段:
- S1: 基礎語言能力與一般知識訓練,使用 30 兆以上的 token(4K 上下文長度)。
- S2: 專注於 STEM、程式碼與推理任務,額外使用 5 兆 token。
- S3: 使用高品質長上下文資料將上下文長度延伸至 32K。
後訓練流程
為了實現混合思考能力,Qwen3 經歷了四階段的後訓練過程:
- 長 CoT 冷啟動: 在涵蓋數學、程式碼與 STEM 的多樣長鏈思考資料上微調。
- 基於推理的 RL: 使用規則式獎勵擴展計算資源以進行強化學習。
- 思考模式融合: 透過在長 CoT 與標準指令微調資料的混合上微調,整合非思考能力。
- 通用 RL: 在 20 多個通用領域任務上應用 RL,以提升指令遵循、格式化與代理能力。
代理能力與整合
Qwen3 針對工具呼叫進行了最佳化,並支援 Model Context Protocol(MCP)。在實作上,Qwen 建議使用 Qwen-Agent 框架,以簡化工具呼叫模板與解析器。
部署建議
- 服務框架: SGLang (
>=0.4.6.post1) 或 vLLM (>=0.8.4),用於相容 OpenAI 的 API 端點。 - 本機使用: Ollama、LMStudio、MLX、llama.cpp 與 KTransformers。
Sources
- OriginalQwen3: Think Deeper, Act Faster