Qwen 3.5‑397B‑A17B 釋出:混合線性注意力 MoE 模型,具備 1 M 令牌上下文與最先進的多模態效能

TL;DR

Qwen 3.5‑397B‑A17B,Qwen 3.5 系列的首個開放權重模型,是一個 397 0 億參數的視覺‑語言模型,前向傳播時僅啟用 170 億參數,於語言、程式碼、推理與多模態基準上達到最先進的表現,同時保持推理速度快且成本低。


1. 這次宣布了什麼?

Qwen AI 發布了 Qwen 3.5‑397B‑A17B,這是 Qwen 3.5 系列的首款模型。它是一個 原生多模態(視覺‑語言)模型,結合了 透過 Gated Delta Networks 實現的線性注意力稀疏混合專家(Mixture‑of‑Experts, MoE) 架構。對於任意輸入,僅有 17 B 參數被激活,使其在 32 k 上下文下比先前的 Qwen 3‑Max‑Base 快 8.6 倍,在 256 k 上下文下快 19.0 倍,同時保持相當的準確度。


2. 核心技術創新

2.1 混合注意力 + 稀疏 MoE

  • Gated Delta Network(GDN) 提供線性時間的注意力,極大降低了傳統自注意力的二次成本。
  • 稀疏 MoE 層 將每個 token 路由至少數專家,無論模型總大小如何,激活的參數始終限制在 17 B。
  • 兩者結合產生 高吞吐量(在 256 k 上下文下比 Qwen 3‑Max‑Base 快至 19 倍),而不犧牲 397 B 模型的表現力。

2.2 效率技巧

  • 多 token 預測穩定性優化 使得在極端規模下的訓練保持穩定。
  • FP8 pipeline(激活、MoE 路由與 GEMM 使用 FP8)將激活記憶體減少約 50 %,並提升超過 10 % 的速度,同時關鍵層仍保留 BF16 精度。
  • 非同步 RL 框架 支援所有 Qwen 3.5 大小,能以動態負載平衡與低梯度陳舊度進行大規模多回合、多模態強化學習(RL)訓練。

2.3 語言覆蓋

  • 詞彙表擴展至 250 k token
  • 支援語言 從 119 種增至 201 種(包括多種方言),提升全球可及性。

3. 基準表現

Qwen 3.5‑397B‑A17B 在多項前沿基準上進行了評測。下表突顯了最相關的分數(除非另有說明,分數越高越好)。所有數據均來自官方 Qwen 3.5 釋出。

類別 基準 Qwen 3.5‑397B‑A17B 最接近的競爭者
知識 MMLU‑Pro 87.4 GPT‑5.2 (89.5)
MMLU‑Redux 95.0 GPT‑5.2 (95.6)
C‑Eval 90.5 Claude 4.5 Opus (92.2)
推理 LiveCodeBench v6 87.7 GPT‑5.2 (84.8)
HMMT Feb 25 99.4 Claude 4.5 Opus (92.9)
程式碼 Code‑Interpreter (IFEval) 94.8 GPT‑5.2 (90.9)
多模態 MMMU‑Pro 85.0 Gemini‑3 Pro (70.4)
MathVision 84.2 GPT‑5.2 (74.6)
Real‑world VQA (RealWorldQA) 81.0 Gemini‑3 Pro (77.0)
代理 / 工具使用 General Agent (BFCL‑V4) 63.1 Claude 4.5 Opus (77.5)
Tool Decathlon 43.8 GPT‑5.2 (43.5)
Search Agent (HLE w/ tool) 45.5 Gemini‑3 Pro (49.8)

整體而言,Qwen 3.5‑397B‑A17B 在語言、推理、程式碼與多模態任務上匹配或超越現有最強模型,同時每次推理僅使用極少的活躍參數。


4. 多模態能力

模態 代表性基準 Qwen 3.5‑397B‑A17B 分數
STEM & Puzzle MMMU 85.0
數學視覺 MathVista (mini) 90.1
一般 VQA RealWorldQA 81.0
文件理解 OmniDocBench 1.5 90.8
OCR / 圖中文字 OCRBench 93.1
空間推理 RefCOCO (avg) 87.8
影片理解 VideoMME (w/ sub.) 87.4

模型可在單次前向傳播中處理 高達 1 M token(約 2 小時影片),支援端到端的影片‑程式碼、影片摘要與多模態規劃。


5. 系統層級基礎設施

  • 異構平行化:視覺與語言管線使用不同的平行策略,避免單一巨型模型的低效。
  • 接近 100 % 的訓練吞吐量,在混合文字‑影像‑影片資料上相較純文字基線提升顯著。
  • FP8‑啟用管線將激活記憶體減半,並帶來超過 10 % 的加速,同時對數值敏感層保留 BF16。
  • 可擴展的非同步 RL 引擎——支援多回合、多模態環境、投機解碼、rollout‑router 重放與細粒度故障恢復,實現 3×–5× 的端到端加速

6. 如何使用 Qwen 3.5

6.1 Qwen Chat(互動式)

提供三種互動模式:

  • Auto – 具備自適應推理與工具使用(搜尋、程式碼解譯器)。
  • Thinking – 針對困難問題的深度思考鏈。
  • Fast – 無工具呼叫的即時回覆。

6.2 Qwen 3.5‑Plus(在阿里雲 ModelStudio 上託管)

透過環境變數啟用進階功能:

export DASHSCOPE_API_KEY=your_key
export DASHSCOPE_MODEL=qwen3.5-plus   # optional override
# Enable reasoning chain‑of‑thought
export ENABLE_THINKING=true
# Enable web search & code interpreter
export ENABLE_SEARCH=true

最小化的 Python 範例:

from openai import OpenAI
import os
client = OpenAI(api_key=os.getenv("DASHSCOPE_API_KEY"),
                base_url=os.getenv("DASHSCOPE_BASE_URL",
                                   "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"))
resp = client.chat.completions.create(
    model=os.getenv("DASHSCOPE_MODEL", "qwen3.5-plus"),
    messages=[{"role": "user", "content": "Introduce Qwen 3.5."}],
    extra_body={"enable_thinking": True, "enable_search": False},
    stream=True)
for chunk in resp:
    print(chunk.choices[0].delta.get("content", ""), end="")

同一端點同時支援 Qwen CodeQwen Visual Agentsvibe‑coding 體驗。


7. 影響與未來方向

  • 原生多模態推理:透過在 Transformer 堆疊早期融合視覺,Qwen 3.5 能在單次傳播中同時推理圖像、影片與文字,邁向 通用 AI 代理 的關鍵一步。
  • 參數效率擴展:每個 token 只激活 4–5 % 的總參數,證明巨型模型在推理成本上不必過於昂貴。
  • 強化學習驅動的代理:非同步 RL 框架使得在長時程、多模態環境中訓練代理成為可能,為持續記憶增強助理鋪路。
  • 更廣的可及性:支援 201 種語言與 250 k token 詞彙,降低非英語開發者與企業的使用門檻。
  • 路線圖:Qwen 團隊暗示即將發布技術報告,將詳述更大規模實驗、更多樣化的 RL 環境,以及外部工具(如檢索、規劃與經濟感知)的更深整合。

8. 結論

Qwen 3.5‑397B‑A17B 證明 大規模多模態模型可以同時兼具強大與高效。其混合線性注意力 + MoE 設計在保持接近最先進準確度的同時,使推理成本與 1 T 參數模型相當。開放權重釋出、完整基準套件與即用的雲端服務,使其成為下一代 AI 助手、自治代理與多模態應用的有力基礎。


關鍵要點

  • 總參數 397 B,單 token 僅激活 17 B → 比 Qwen 3‑Max‑Base 快至 19 倍。
  • 在語言、程式碼、推理與視覺任務上達到最先進成果。
  • 1 M token 上下文窗口,支援長篇影片與文件處理。
  • 開放權重模型加上託管的 Qwen 3.5‑Plus,可直接投入生產使用。

參考資料

  • Qwen AI 部落格文章 – Qwen 3.5: Towards Native Multimodal Agents(2026‑02‑14)。
  • 官方模型卡於 GitHub、Hugging Face 與 ModelScope。
  • 基準套件:MMLU‑Pro、C‑Eval、LiveCodeBench v6、MMMU‑Pro、VideoMME 等。

Sources