Qwen 3.5‑397B‑A17B 釋出:混合線性注意力 MoE 模型,具備 1 M 令牌上下文與最先進的多模態效能
TL;DR
Qwen 3.5‑397B‑A17B,Qwen 3.5 系列的首個開放權重模型,是一個 397 0 億參數的視覺‑語言模型,前向傳播時僅啟用 170 億參數,於語言、程式碼、推理與多模態基準上達到最先進的表現,同時保持推理速度快且成本低。
1. 這次宣布了什麼?
Qwen AI 發布了 Qwen 3.5‑397B‑A17B,這是 Qwen 3.5 系列的首款模型。它是一個 原生多模態(視覺‑語言)模型,結合了 透過 Gated Delta Networks 實現的線性注意力 與 稀疏混合專家(Mixture‑of‑Experts, MoE) 架構。對於任意輸入,僅有 17 B 參數被激活,使其在 32 k 上下文下比先前的 Qwen 3‑Max‑Base 快 8.6 倍,在 256 k 上下文下快 19.0 倍,同時保持相當的準確度。
2. 核心技術創新
2.1 混合注意力 + 稀疏 MoE
- Gated Delta Network(GDN) 提供線性時間的注意力,極大降低了傳統自注意力的二次成本。
- 稀疏 MoE 層 將每個 token 路由至少數專家,無論模型總大小如何,激活的參數始終限制在 17 B。
- 兩者結合產生 高吞吐量(在 256 k 上下文下比 Qwen 3‑Max‑Base 快至 19 倍),而不犧牲 397 B 模型的表現力。
2.2 效率技巧
- 多 token 預測 與 穩定性優化 使得在極端規模下的訓練保持穩定。
- FP8 pipeline(激活、MoE 路由與 GEMM 使用 FP8)將激活記憶體減少約 50 %,並提升超過 10 % 的速度,同時關鍵層仍保留 BF16 精度。
- 非同步 RL 框架 支援所有 Qwen 3.5 大小,能以動態負載平衡與低梯度陳舊度進行大規模多回合、多模態強化學習(RL)訓練。
2.3 語言覆蓋
- 詞彙表擴展至 250 k token。
- 支援語言 從 119 種增至 201 種(包括多種方言),提升全球可及性。
3. 基準表現
Qwen 3.5‑397B‑A17B 在多項前沿基準上進行了評測。下表突顯了最相關的分數(除非另有說明,分數越高越好)。所有數據均來自官方 Qwen 3.5 釋出。
| 類別 | 基準 | Qwen 3.5‑397B‑A17B | 最接近的競爭者 |
|---|---|---|---|
| 知識 | MMLU‑Pro | 87.4 | GPT‑5.2 (89.5) |
| MMLU‑Redux | 95.0 | GPT‑5.2 (95.6) | |
| C‑Eval | 90.5 | Claude 4.5 Opus (92.2) | |
| 推理 | LiveCodeBench v6 | 87.7 | GPT‑5.2 (84.8) |
| HMMT Feb 25 | 99.4 | Claude 4.5 Opus (92.9) | |
| 程式碼 | Code‑Interpreter (IFEval) | 94.8 | GPT‑5.2 (90.9) |
| 多模態 | MMMU‑Pro | 85.0 | Gemini‑3 Pro (70.4) |
| MathVision | 84.2 | GPT‑5.2 (74.6) | |
| Real‑world VQA (RealWorldQA) | 81.0 | Gemini‑3 Pro (77.0) | |
| 代理 / 工具使用 | General Agent (BFCL‑V4) | 63.1 | Claude 4.5 Opus (77.5) |
| Tool Decathlon | 43.8 | GPT‑5.2 (43.5) | |
| Search Agent (HLE w/ tool) | 45.5 | Gemini‑3 Pro (49.8) |
整體而言,Qwen 3.5‑397B‑A17B 在語言、推理、程式碼與多模態任務上匹配或超越現有最強模型,同時每次推理僅使用極少的活躍參數。
4. 多模態能力
| 模態 | 代表性基準 | Qwen 3.5‑397B‑A17B 分數 |
|---|---|---|
| STEM & Puzzle | MMMU | 85.0 |
| 數學視覺 | MathVista (mini) | 90.1 |
| 一般 VQA | RealWorldQA | 81.0 |
| 文件理解 | OmniDocBench 1.5 | 90.8 |
| OCR / 圖中文字 | OCRBench | 93.1 |
| 空間推理 | RefCOCO (avg) | 87.8 |
| 影片理解 | VideoMME (w/ sub.) | 87.4 |
模型可在單次前向傳播中處理 高達 1 M token(約 2 小時影片),支援端到端的影片‑程式碼、影片摘要與多模態規劃。
5. 系統層級基礎設施
- 異構平行化:視覺與語言管線使用不同的平行策略,避免單一巨型模型的低效。
- 接近 100 % 的訓練吞吐量,在混合文字‑影像‑影片資料上相較純文字基線提升顯著。
- FP8‑啟用管線將激活記憶體減半,並帶來超過 10 % 的加速,同時對數值敏感層保留 BF16。
- 可擴展的非同步 RL 引擎——支援多回合、多模態環境、投機解碼、rollout‑router 重放與細粒度故障恢復,實現 3×–5× 的端到端加速。
6. 如何使用 Qwen 3.5
6.1 Qwen Chat(互動式)
提供三種互動模式:
- Auto – 具備自適應推理與工具使用(搜尋、程式碼解譯器)。
- Thinking – 針對困難問題的深度思考鏈。
- Fast – 無工具呼叫的即時回覆。
6.2 Qwen 3.5‑Plus(在阿里雲 ModelStudio 上託管)
透過環境變數啟用進階功能:
export DASHSCOPE_API_KEY=your_key
export DASHSCOPE_MODEL=qwen3.5-plus # optional override
# Enable reasoning chain‑of‑thought
export ENABLE_THINKING=true
# Enable web search & code interpreter
export ENABLE_SEARCH=true
最小化的 Python 範例:
from openai import OpenAI
import os
client = OpenAI(api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url=os.getenv("DASHSCOPE_BASE_URL",
"https://dashscope-intl.aliyuncs.com/compatible-mode/v1"))
resp = client.chat.completions.create(
model=os.getenv("DASHSCOPE_MODEL", "qwen3.5-plus"),
messages=[{"role": "user", "content": "Introduce Qwen 3.5."}],
extra_body={"enable_thinking": True, "enable_search": False},
stream=True)
for chunk in resp:
print(chunk.choices[0].delta.get("content", ""), end="")
同一端點同時支援 Qwen Code、Qwen Visual Agents 與 vibe‑coding 體驗。
7. 影響與未來方向
- 原生多模態推理:透過在 Transformer 堆疊早期融合視覺,Qwen 3.5 能在單次傳播中同時推理圖像、影片與文字,邁向 通用 AI 代理 的關鍵一步。
- 參數效率擴展:每個 token 只激活 4–5 % 的總參數,證明巨型模型在推理成本上不必過於昂貴。
- 強化學習驅動的代理:非同步 RL 框架使得在長時程、多模態環境中訓練代理成為可能,為持續記憶增強助理鋪路。
- 更廣的可及性:支援 201 種語言與 250 k token 詞彙,降低非英語開發者與企業的使用門檻。
- 路線圖:Qwen 團隊暗示即將發布技術報告,將詳述更大規模實驗、更多樣化的 RL 環境,以及外部工具(如檢索、規劃與經濟感知)的更深整合。
8. 結論
Qwen 3.5‑397B‑A17B 證明 大規模多模態模型可以同時兼具強大與高效。其混合線性注意力 + MoE 設計在保持接近最先進準確度的同時,使推理成本與 1 T 參數模型相當。開放權重釋出、完整基準套件與即用的雲端服務,使其成為下一代 AI 助手、自治代理與多模態應用的有力基礎。
關鍵要點
- 總參數 397 B,單 token 僅激活 17 B → 比 Qwen 3‑Max‑Base 快至 19 倍。
- 在語言、程式碼、推理與視覺任務上達到最先進成果。
- 1 M token 上下文窗口,支援長篇影片與文件處理。
- 開放權重模型加上託管的 Qwen 3.5‑Plus,可直接投入生產使用。
參考資料
- Qwen AI 部落格文章 – Qwen 3.5: Towards Native Multimodal Agents(2026‑02‑14)。
- 官方模型卡於 GitHub、Hugging Face 與 ModelScope。
- 基準套件:MMLU‑Pro、C‑Eval、LiveCodeBench v6、MMMU‑Pro、VideoMME 等。