Qwen3.8-Flash-Next 发布说明 / 新特性

Qwen3.8-Flash-Next 是一款多模态混合专家 (MoE) 模型,作为即将推出的 Qwen4 系列的架构预览。它引入了混合 Gated DeltaNet (GDN) 和 Qwen Sparse Attention (QSA) 设计,以优化计算效率和模型容量,在提供卓越的代码编写和办公生产力任务性能的同时,将训练成本降低至约 Qwen3.7-Plus 所需成本的 1/9。

模型架构与技术创新

Qwen3.8-Flash-Next 在四个主要技术维度进行了系统性升级:注意力机制、残差流、嵌入层和优化器。

混合注意力机制:GDN 与 QSA

为了在内存效率与精确检索之间取得平衡,该模型采用了混合架构,其中每四层中有三层使用 Gated DeltaNet (GDN) 将历史信息压缩为固定大小的状态。其余一层则采用由 Qwen Sparse Attention (QSA) 增强的全局注意力机制。

QSA 通过使用轻量级索引器将序列聚合为微块 (micro-blocks),从而降低长序列计算的开销。它在块级别估计重要性并为注意力机制选择相关区域,从而降低了注意力成本和索引开销。在 100 万 token 的上下文长度下,QSA 的注意力内核在 prefill 阶段实现了高达 7.6 倍的加速,在 decode 阶段实现了 4.9 倍的加速。

门控残差 (GR)

为了防止深层网络中早期特征的稀释,门控残差 (GR) 将传统的单一残差流扩展为四个并行分支。一个动态的逐元素门控控制着这些分支间信息的读取与写入,从而加强了跨层信息流并提高了训练稳定性。残差状态还支持 FP8 存储,以进一步降低内存访问开销。

N-gram 嵌入

为了在不增加单 token 计算量的情况下扩展模型容量,Qwen3.8-Flash-Next 引入了 N-gram 嵌入。该方法基于当前 token 和若干前序 token 进行查找,以表示常见的短语和局部模式。模型包含 51B N-gram 嵌入参数,这些参数可以卸载到主机内存并进行异步预取,从而确保它们不会占用永久的 GPU 显存。

通过 Muon 进行优化

该模型使用 Muon 优化器进行训练,该优化器专门针对正交化精度和融合参数矩阵的分离进行了优化。Muon 被应用于二维线性映射(Attention、GDN 和 MoE Experts),而 AdamW 则保留用于嵌入层、MoE router 以及 GR 中的低秩参数。这种协同设计允许使用更大的学习率和 batch size,从而提高了收敛效率。

模型规格与能力

Qwen3.8-Flash-Next 拥有 125B 参数的主模型,并带有额外的 51B N-gram 嵌入,每个 token 激活 6B 参数。

上下文窗口与性能

  • 上下文支持: 原生支持 262,144 tokens,通过 YaRN 可扩展至 1,000,000 tokens。
  • 效率: 在前缀缓存命中率为 90% 的推理场景下,它在 1M tokens 时实现的 prefill 吞吐量是 Qwen3.7-Plus 的 8.6 倍。
  • 定价: 生产版本 (Qwen3.8-Flash) 的价格为每百万输入 tokens 0.16 USD,每百万输出 tokens 0.47 USD。

基准测试

在基础模型对比中,Qwen3.8-Flash-Next-Base 在 14 项基准测试中的 8 项上优于 Qwen3.8-27B-Base 和 Qwen3.7-Plus-Base,包括 MMLU-Pro、SuperGPQA、BBH、GSM8K、EvalPlus、SWEBench-Pretrain、MGSM 和 MMMLU。

对于智能体 (agentic) 和代码编写任务,该模型表现出显著提升:

  • DeepSWE 1.1: 58.7 (相比于 Qwen3.7-Plus 的 16.5)。
  • SWE-bench Pro: 62.5 (相比于 Qwen3.7-Plus 的 55.8)。
  • CoWorkBench: 73.9 (相比于 Qwen3.7-Plus 的 65.1)。
  • LiveCodeBench v6: 91.9。

多模态与视觉语言性能

Qwen3.8-Flash-Next 展现了强大的多模态智能体能力和通用感知能力:

  • 多模态工具使用 (ClawEval-MM): 64.4 Pass@3。
  • 移动端使用 (AndroidWorld): 84.5。
  • 计算机使用 (OSWorld 2.0): 19.4 Binary / 52.3 Partial。
  • 长视频理解 (LVBench): 76.6。
  • 视觉数学 (MathVision): 95.7 (含 CI)。

集成与可用性

权重已在 Hugging Face 和 ModelScope 上发布。该模型通过 QwenCloud 以 qwen3.8-flash 的名称提供服务,并支持 OpenAI 兼容的 Chat Completions 和 Responses APIs,以及兼容 Anthropic 的接口,以便直接与 Claude Code 等工具集成。

Sources

相关