Qwen3 版本說明:混合思考與多語言 MoE 模型

Qwen3 引入了一種混合推理架構,使用者可以在針對複雜問題解決的深度「思考模式」與提供快速回應的「非思考模式」之間切換。旗艦模型 Qwen3-235B-A22B 旨在於程式碼、數學及一般能力上與 DeepSeek-R1、o1、o3-mini、Grok-3 與 Gemini-2.5-Pro 等頂級模型競爭。

模型陣容與架構

Qwen3 以 Mixture-of-Experts(MoE)與密集模型兩種形式提供,皆採用 Apache 2.0 授權。MoE 模型設計注重效率,基礎模型的效能與 Qwen2.5 密集模型相近,卻僅使用 10% 的活躍參數。

MoE 模型

模型 總參數量 啟用參數量 層數 頭數 (Q/KV) 上下文長度
Qwen3-235B-A22B 235B 22B 94 64 / 4 128K
Qwen3-30B-A3B 30B 3B 48 32 / 4 128K

密集模型

模型 層數 頭數 (Q/KV) 共享嵌入 上下文長度
Qwen3-32B 64 64 / 8 128K
Qwen3-14B 40 40 / 8 128K
Qwen3-8B 36 32 / 8 128K
Qwen3-4B 36 32 / 8 32K
Qwen3-1.7B 28 16 / 8 32K
Qwen3-0.6B 28 16 / 8 32K

混合思考與預算控制

Qwen3 實作了雙模式推理方法,使計算推理預算與效能提升之間能夠以可擴展且平滑的方式相關聯。

  • 思考模式: 模型在給出最終答案前逐步推理,針對複雜任務進行最佳化。
  • 非思考模式: 模型對較簡單的查詢提供近乎即時的回應,速度優先於深度。

使用者可透過聊天範本中的 enable_thinking 參數控制此行為,或在提示詞中使用類似 /think/no_think 的軟切換標籤,在多輪對話中動態切換模式。

預訓練與資料集擴充

Qwen3 以約 36 兆個 token 進行預訓練——幾乎是 Qwen2.5 使用的 18 兆的兩倍——涵蓋 119 種語言與方言。資料收集過程包括透過 Qwen2.5-VL 擷取的網路資料與類 PDF 文件,並由 Qwen2.5 精練。數學與程式碼的合成資料則使用 Qwen2.5-Math 與 Qwen2.5-Coder 產生。

預訓練分為三個階段:

  1. S1: 基礎語言能力與一般知識訓練,使用 30 兆以上的 token(4K 上下文長度)。
  2. S2: 專注於 STEM、程式碼與推理任務,額外使用 5 兆 token。
  3. S3: 使用高品質長上下文資料將上下文長度延伸至 32K。

後訓練流程

為了實現混合思考能力,Qwen3 經歷了四階段的後訓練過程:

  1. 長 CoT 冷啟動: 在涵蓋數學、程式碼與 STEM 的多樣長鏈思考資料上微調。
  2. 基於推理的 RL: 使用規則式獎勵擴展計算資源以進行強化學習。
  3. 思考模式融合: 透過在長 CoT 與標準指令微調資料的混合上微調,整合非思考能力。
  4. 通用 RL: 在 20 多個通用領域任務上應用 RL,以提升指令遵循、格式化與代理能力。

代理能力與整合

Qwen3 針對工具呼叫進行了最佳化,並支援 Model Context Protocol(MCP)。在實作上,Qwen 建議使用 Qwen-Agent 框架,以簡化工具呼叫模板與解析器。

部署建議

  • 服務框架: SGLang (>=0.4.6.post1) 或 vLLM (>=0.8.4),用於相容 OpenAI 的 API 端點。
  • 本機使用: Ollama、LMStudio、MLX、llama.cpp 與 KTransformers。

Sources