Qwen 3.5‑397B‑A17B 发布:混合线性注意力 MoE 模型,具备 1 M 令牌上下文和最先进的多模态性能

TL;DR

Qwen 3.5‑397B‑A17B 是 Qwen 3.5 系列的首个开源权重模型,拥有 3970 亿参数的视觉语言模型,在每次前向传播中仅激活 170 亿参数,在语言、编码、推理和多模态基准上实现最先进的性能,同时保持推理快速且低成本。


1. 公告内容

Qwen AI 发布了 Qwen 3.5‑397B‑A17B,这是 Qwen 3.5 系列的首个模型。它是一个 原生多模态(视觉‑语言)模型,结合了 通过 Gated Delta Networks 实现的线性注意力稀疏混合专家(Mixture‑of‑Experts, MoE) 架构。对于任意输入,仅有 170 B(相对于 3970 B)参数被激活,相比之前的 Qwen 3‑Max‑Base 在 32 k 上下文下提升 8.6 倍、在 256 k 上下文下提升 19.0 倍的速度,同时保持相近的准确度。


2. 核心技术创新

2.1 混合注意力 + 稀疏 MoE

  • Gated Delta Network (GDN) 提供线性时间注意力,显著降低经典自注意力的二次成本。
  • 稀疏 MoE 层 将每个令牌路由到少量专家,限制激活参数数量为 170 B,无论模型总体规模如何。
  • 这种组合实现了 高吞吐量(在 256 k 上下文下比 Qwen 3‑Max‑Base 快至 19 倍),且不牺牲 3970 B 模型的表达能力。

2.2 效率技巧

  • 多令牌预测稳定性优化 在极端规模下保持训练的稳定性。
  • FP8 流水线(激活、MoE 路由和 GEMM 使用 FP8)将激活内存降低约 50%,并带来超过 10% 的加速,同时关键层保持 BF16 精度。
  • 异步 RL 框架 支持所有 Qwen 3.5 规模,能够进行大规模多轮、多模态强化学习(RL)训练,具备动态负载均衡和低梯度陈旧度。

2.3 语言覆盖

  • 词表扩展至 250 k 令牌
  • 支持语言 从 119 种增加到 201 种(包括许多方言),提升了全球可及性。

3. 基准性能

Qwen 3.5‑397B‑A17B 在一系列前沿基准上进行了评估。下表突出显示了最相关的得分(除非另有说明,数值越高越好)。所有数据均来自官方 Qwen 3.5 发布。

类别 基准 Qwen 3.5‑397B‑A17B 最近竞争者
知识 MMLU‑Pro 87.4 GPT‑5.2 (89.5)
MMLU‑Redux 95.0 GPT‑5.2 (95.6)
C‑Eval 90.5 Claude 4.5 Opus (92.2)
推理 LiveCodeBench v6 87.7 GPT‑5.2 (84.8)
HMMT Feb 25 99.4 Claude 4.5 Opus (92.9)
编码 Code‑Interpreter (IFEval) 94.8 GPT‑5.2 (90.9)
多模态 MMMU‑Pro 85.0 Gemini‑3 Pro (70.4)
MathVision 84.2 GPT‑5.2 (74.6)
Real‑world VQA (RealWorldQA) 81.0 Gemini‑3 Pro (77.0)
代理 / 工具使用 General Agent (BFCL‑V4) 63.1 Claude 4.5 Opus (77.5)
Tool Decathlon 43.8 GPT‑5.2 (43.5)
Search Agent (HLE w/ tool) 45.5 Gemini‑3 Pro (49.8)

总体而言,Qwen 3.5‑397B‑A17B 在语言、推理、编码和多模态任务上匹配或超越最强现有模型,同时每次推理使用的激活参数远少于其他模型。


4. 多模态能力

模态 代表性基准 Qwen 3.5‑397B‑A17B 得分
STEM 与谜题 MMMU 85.0
数学导向视觉 MathVista (mini) 90.1
通用视觉问答 RealWorldQA 81.0
文档理解 OmniDocBench 1.5 90.8
OCR / 图像内文本 OCRBench 93.1
空间推理 RefCOCO (avg) 87.8
视频理解 VideoMME (w/ sub.) 87.4

该模型在单次前向传播中可处理 最高 1 M 令牌(约 2 小时视频),实现端到端的视频转代码、视频摘要以及多模态规划。


5. 系统层级基础设施

  • 异构并行:视觉和语言流水线使用独立的并行策略,避免了单一整体方法的低效。
  • 与纯文本基线相比,在混合文本‑图像‑视频数据上实现 接近 100 % 的训练吞吐量
  • FP8 启用的流水线 将激活内存降低约 50%,并带来超过 10% 的加速,同时对数值敏感层保持 BF16。
  • 可扩展的异步 RL 引擎——支持多轮、多模态环境、推测解码、回滚路由重放以及细粒度故障恢复,提供 3×–5× 的端到端加速

6. 如何使用 Qwen 3.5

6.1 Qwen Chat(交互式)

提供三种交互模式:

  • Auto – 具备工具使用的自适应推理(搜索、代码解释器)。
  • Thinking – 针对难题的深度思考链。
  • Fast – 无工具调用的即时回答。

6.2 Qwen 3.5‑Plus(托管于阿里云 ModelStudio)

通过环境变量启用高级功能:

export DASHSCOPE_API_KEY=your_key
export DASHSCOPE_MODEL=qwen3.5-plus   # optional override
# Enable reasoning chain‑of‑thought
export ENABLE_THINKING=true
# Enable web search & code interpreter
export ENABLE_SEARCH=true

一个最小的 Python 示例:

from openai import OpenAI
import os
client = OpenAI(api_key=os.getenv("DASHSCOPE_API_KEY"),
                base_url=os.getenv("DASHSCOPE_BASE_URL",
                                   "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"))
resp = client.chat.completions.create(
    model=os.getenv("DASHSCOPE_MODEL", "qwen3.5-plus"),
    messages=[{"role": "user", "content": "Introduce Qwen 3.5."}],
    extra_body={"enable_thinking": True, "enable_search": False},
    stream=True)
for chunk in resp:
    print(chunk.choices[0].delta.get("content", ""), end="")

相同的端点还支持 Qwen CodeQwen Visual Agentsvibe‑coding 体验。


7. 含义与未来方向

  • 原生多模态推理:通过在 Transformer 堆栈早期融合视觉,Qwen 3.5 能在单次前向传播中对图像、视频和文本进行推理,这是迈向 通用 AI 代理 的关键一步。
  • 参数高效扩展:每个令牌仅激活总参数的 4–5%,表明大模型在推理时不必成本高昂。
  • 强化学习驱动的代理:异步 RL 框架使得在长时程、多模态环境中训练代理成为可能,为持久的、记忆增强的助手铺平道路。
  • 更广泛的可及性:支持 201 种语言和 250 k 令牌词表,降低了非英语开发者和企业的使用门槛。
  • 路线图:Qwen 团队暗示即将发布的技术报告将详细阐述更大规模实验、更丰富的 RL 环境以及更深度的外部工具集成(如检索、规划和经济感知)。

8. 结论

Qwen 3.5‑397B‑A17B 证明了 大规模多模态模型既可以强大又高效。其混合线性注意力 + MoE 设计在保持接近最先进准确度的同时,使推理成本与 1 T 参数模型相当。开源权重发布、丰富的基准套件以及即用型云服务,使其成为下一代 AI 助手、自治代理和多模态应用的有力基础。


关键要点

  • 总计 397 B 参数,每个令牌激活 17 B → 推理速度比 Qwen 3‑Max‑Base 快至 19 倍。
  • 在语言、编码、推理和视觉任务上取得最先进的结果。
  • 1 M 令牌上下文窗口,支持长时段视频和文档处理。
  • 开源权重模型加上托管的 Qwen 3.5‑Plus,可直接用于生产。

参考文献

  • Qwen AI 博客文章 – Qwen 3.5:迈向原生多模态代理(2026‑02‑14)。
  • 官方模型卡片位于 GitHub、Hugging Face 和 ModelScope。
  • 基准套件:MMLU‑Pro、C‑Eval、LiveCodeBench v6、MMMU‑Pro、VideoMME 等。

Sources