Qwen 3.5‑397B‑A17B 发布:混合线性注意力 MoE 模型,具备 1 M 令牌上下文和最先进的多模态性能
TL;DR
Qwen 3.5‑397B‑A17B 是 Qwen 3.5 系列的首个开源权重模型,拥有 3970 亿参数的视觉语言模型,在每次前向传播中仅激活 170 亿参数,在语言、编码、推理和多模态基准上实现最先进的性能,同时保持推理快速且低成本。
1. 公告内容
Qwen AI 发布了 Qwen 3.5‑397B‑A17B,这是 Qwen 3.5 系列的首个模型。它是一个 原生多模态(视觉‑语言)模型,结合了 通过 Gated Delta Networks 实现的线性注意力 与 稀疏混合专家(Mixture‑of‑Experts, MoE) 架构。对于任意输入,仅有 170 B(相对于 3970 B)参数被激活,相比之前的 Qwen 3‑Max‑Base 在 32 k 上下文下提升 8.6 倍、在 256 k 上下文下提升 19.0 倍的速度,同时保持相近的准确度。
2. 核心技术创新
2.1 混合注意力 + 稀疏 MoE
- Gated Delta Network (GDN) 提供线性时间注意力,显著降低经典自注意力的二次成本。
- 稀疏 MoE 层 将每个令牌路由到少量专家,限制激活参数数量为 170 B,无论模型总体规模如何。
- 这种组合实现了 高吞吐量(在 256 k 上下文下比 Qwen 3‑Max‑Base 快至 19 倍),且不牺牲 3970 B 模型的表达能力。
2.2 效率技巧
- 多令牌预测 与 稳定性优化 在极端规模下保持训练的稳定性。
- FP8 流水线(激活、MoE 路由和 GEMM 使用 FP8)将激活内存降低约 50%,并带来超过 10% 的加速,同时关键层保持 BF16 精度。
- 异步 RL 框架 支持所有 Qwen 3.5 规模,能够进行大规模多轮、多模态强化学习(RL)训练,具备动态负载均衡和低梯度陈旧度。
2.3 语言覆盖
- 词表扩展至 250 k 令牌。
- 支持语言 从 119 种增加到 201 种(包括许多方言),提升了全球可及性。
3. 基准性能
Qwen 3.5‑397B‑A17B 在一系列前沿基准上进行了评估。下表突出显示了最相关的得分(除非另有说明,数值越高越好)。所有数据均来自官方 Qwen 3.5 发布。
| 类别 | 基准 | Qwen 3.5‑397B‑A17B | 最近竞争者 |
|---|---|---|---|
| 知识 | MMLU‑Pro | 87.4 | GPT‑5.2 (89.5) |
| MMLU‑Redux | 95.0 | GPT‑5.2 (95.6) | |
| C‑Eval | 90.5 | Claude 4.5 Opus (92.2) | |
| 推理 | LiveCodeBench v6 | 87.7 | GPT‑5.2 (84.8) |
| HMMT Feb 25 | 99.4 | Claude 4.5 Opus (92.9) | |
| 编码 | Code‑Interpreter (IFEval) | 94.8 | GPT‑5.2 (90.9) |
| 多模态 | MMMU‑Pro | 85.0 | Gemini‑3 Pro (70.4) |
| MathVision | 84.2 | GPT‑5.2 (74.6) | |
| Real‑world VQA (RealWorldQA) | 81.0 | Gemini‑3 Pro (77.0) | |
| 代理 / 工具使用 | General Agent (BFCL‑V4) | 63.1 | Claude 4.5 Opus (77.5) |
| Tool Decathlon | 43.8 | GPT‑5.2 (43.5) | |
| Search Agent (HLE w/ tool) | 45.5 | Gemini‑3 Pro (49.8) |
总体而言,Qwen 3.5‑397B‑A17B 在语言、推理、编码和多模态任务上匹配或超越最强现有模型,同时每次推理使用的激活参数远少于其他模型。
4. 多模态能力
| 模态 | 代表性基准 | Qwen 3.5‑397B‑A17B 得分 |
|---|---|---|
| STEM 与谜题 | MMMU | 85.0 |
| 数学导向视觉 | MathVista (mini) | 90.1 |
| 通用视觉问答 | RealWorldQA | 81.0 |
| 文档理解 | OmniDocBench 1.5 | 90.8 |
| OCR / 图像内文本 | OCRBench | 93.1 |
| 空间推理 | RefCOCO (avg) | 87.8 |
| 视频理解 | VideoMME (w/ sub.) | 87.4 |
该模型在单次前向传播中可处理 最高 1 M 令牌(约 2 小时视频),实现端到端的视频转代码、视频摘要以及多模态规划。
5. 系统层级基础设施
- 异构并行:视觉和语言流水线使用独立的并行策略,避免了单一整体方法的低效。
- 与纯文本基线相比,在混合文本‑图像‑视频数据上实现 接近 100 % 的训练吞吐量。
- FP8 启用的流水线 将激活内存降低约 50%,并带来超过 10% 的加速,同时对数值敏感层保持 BF16。
- 可扩展的异步 RL 引擎——支持多轮、多模态环境、推测解码、回滚路由重放以及细粒度故障恢复,提供 3×–5× 的端到端加速。
6. 如何使用 Qwen 3.5
6.1 Qwen Chat(交互式)
提供三种交互模式:
- Auto – 具备工具使用的自适应推理(搜索、代码解释器)。
- Thinking – 针对难题的深度思考链。
- Fast – 无工具调用的即时回答。
6.2 Qwen 3.5‑Plus(托管于阿里云 ModelStudio)
通过环境变量启用高级功能:
export DASHSCOPE_API_KEY=your_key
export DASHSCOPE_MODEL=qwen3.5-plus # optional override
# Enable reasoning chain‑of‑thought
export ENABLE_THINKING=true
# Enable web search & code interpreter
export ENABLE_SEARCH=true
一个最小的 Python 示例:
from openai import OpenAI
import os
client = OpenAI(api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url=os.getenv("DASHSCOPE_BASE_URL",
"https://dashscope-intl.aliyuncs.com/compatible-mode/v1"))
resp = client.chat.completions.create(
model=os.getenv("DASHSCOPE_MODEL", "qwen3.5-plus"),
messages=[{"role": "user", "content": "Introduce Qwen 3.5."}],
extra_body={"enable_thinking": True, "enable_search": False},
stream=True)
for chunk in resp:
print(chunk.choices[0].delta.get("content", ""), end="")
相同的端点还支持 Qwen Code、Qwen Visual Agents 和 vibe‑coding 体验。
7. 含义与未来方向
- 原生多模态推理:通过在 Transformer 堆栈早期融合视觉,Qwen 3.5 能在单次前向传播中对图像、视频和文本进行推理,这是迈向 通用 AI 代理 的关键一步。
- 参数高效扩展:每个令牌仅激活总参数的 4–5%,表明大模型在推理时不必成本高昂。
- 强化学习驱动的代理:异步 RL 框架使得在长时程、多模态环境中训练代理成为可能,为持久的、记忆增强的助手铺平道路。
- 更广泛的可及性:支持 201 种语言和 250 k 令牌词表,降低了非英语开发者和企业的使用门槛。
- 路线图:Qwen 团队暗示即将发布的技术报告将详细阐述更大规模实验、更丰富的 RL 环境以及更深度的外部工具集成(如检索、规划和经济感知)。
8. 结论
Qwen 3.5‑397B‑A17B 证明了 大规模多模态模型既可以强大又高效。其混合线性注意力 + MoE 设计在保持接近最先进准确度的同时,使推理成本与 1 T 参数模型相当。开源权重发布、丰富的基准套件以及即用型云服务,使其成为下一代 AI 助手、自治代理和多模态应用的有力基础。
关键要点
- 总计 397 B 参数,每个令牌激活 17 B → 推理速度比 Qwen 3‑Max‑Base 快至 19 倍。
- 在语言、编码、推理和视觉任务上取得最先进的结果。
- 1 M 令牌上下文窗口,支持长时段视频和文档处理。
- 开源权重模型加上托管的 Qwen 3.5‑Plus,可直接用于生产。
参考文献
- Qwen AI 博客文章 – Qwen 3.5:迈向原生多模态代理(2026‑02‑14)。
- 官方模型卡片位于 GitHub、Hugging Face 和 ModelScope。
- 基准套件:MMLU‑Pro、C‑Eval、LiveCodeBench v6、MMMU‑Pro、VideoMME 等。