Qwen3.8-Flash-Next 发布说明:Qwen4 架构预览

Qwen3.8-Flash-Next 是一款多模态混合专家 (MoE) 模型,它在注意力机制、残差流、嵌入层和优化方面引入了系统性的架构变革。作为 Qwen4 架构的早期预览版,它在编程和办公任务中的表现优于 Qwen3.7-Plus,而训练成本仅为后者的 1/9。

架构创新

Qwen3.8-Flash-Next 实施了四项主要的技术升级,以提高计算效率和模型容量。

混合注意力:GDN 与 QSA

为了在内存效率与精确检索之间取得平衡,该模型采用了混合架构,其中每四层中有三层利用 Gated DeltaNet (GDN) 将历史信息压缩为固定大小的状态。其余层则使用由 Qwen Sparse Attention (QSA) 增强的全局注意力机制。

QSA 通过使用轻量级索引器将序列聚合为 micro-blocks 来降低长序列计算的开销。通过在块级别而非 token 级别评估重要性,QSA 最小化了索引成本。在 1M-token 上下文长度下,QSA 在 prefill 阶段实现了高达 7.6 倍的加速,在 decode 阶段实现了 4.9 倍的加速。在具有 90% 前缀缓存命中率的场景下,其 prefill 吞吐量是 Qwen3.7-Plus 的 8.6 倍。

门控残差 (GR) 流

为了防止深层网络中早期层特征的稀释,Gated Residual (GR) 将传统的单残差流扩展为四个并行分支。一个动态的逐元素门控控制着信息如何从这些分支中读取和写入。

这种设计允许模型维持从早期注意力层到深层层的长程路径。此外,GR 机制抑制了激活值离群点,提高了训练稳定性,并支持 FP8 storage 以减少内存访问开销。

用于可扩展容量的 N-gram 嵌入

Qwen3.8-Flash-Next 结合了 N-gram Embedding,它基于局部上下文(当前 token 和前序 token)而非单个 token 进行查找。这增加了一种“局部模式记忆”,在几乎不增加单 token 计算量的情况下提升了模型容量。

除了 125B 的主模型参数外,该模型还包含 51B N-gram embedding 参数。为了避免 GPU 显存饱和,这些参数可以存储在主机内存中,并在模型计算期间进行异步预取。

通过 Muon 进行优化

该模型使用 Muon 优化器 进行训练,该优化器专门针对正交化精度和融合参数矩阵的分离进行了优化。Muon 被应用于二维线性映射(Attention、GDN 和 MoE Experts),而 AdamW 则保留用于嵌入层、MoE router 和 GR 低秩参数。

关键优化发现包括:

  • Scaling Law 重新拟合:新架构允许使用更大的学习率和 batch size。
  • Batch Size 预热:团队发现直接使用目标 batch size 比逐步预热更有效,相比逐步预热减少了 18.8% 的优化器步数。

模型规格与性能

Qwen3.8-Flash-Next 拥有 125B 参数的主模型,每个 token 激活 6B 参数。它原生支持 262,144 tokens 的上下文窗口,并可通过 YaRN 扩展至 1,000,000 tokens

基准测试

在语言和编程任务中,Qwen3.8-Flash-Next 的表现优于多个竞争对手和之前的版本:

Benchmark Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash
DeepSWE 1.1 58.7 42.2 16.5 54.4
SWE-bench Pro 62.5 61.7 55.8 56.0
CoWorkBench 73.9 70.7 65.1 45.1
GPQA Diamond 91.7 89.2 90.3 90.8
LiveCodeBench v6 91.9 90.3 89.6 90.6

在视觉语言任务中,该模型展示了强大的智能体 (agentic) 能力,特别是在 AndroidWorld (84.5)OSWorld 2.0 (52.3 partial) 中,表现显著超过了 Qwen3.7-Plus。

部署与定价

Qwen3.8-Flash-Next 作为开源权重模型可在 Hugging Face 和 ModelScope 上获取。生产版本 Qwen3.8-Flash 通过 QwenCloud 提供服务,定价如下:

  • Input: 0.16 USD per million tokens
  • Output: 0.47 USD per million tokens

社区洞察与技术讨论

社区反馈突出了新架构的效率提升以及硬件要求:

  • 硬件约束:用户指出 51B N-gram embedding 参数显著增加了内存占用。虽然 6B 的激活参数有助于缓解内存带宽压力,但总容量使得对于内存小于 128GB 的用户来说极具挑战。一位用户指出:

    "the 50B ngram sidecar makes it impossible... the new ngram architecture makes it pretty much unusable for regular folks who cant afford more than 32-64 GB ram."

  • 本地执行:早期采用者报告在 Ryzen 395 / Strix Halo 硬件上成功运行,速度约为 22 tokens/s。一些用户已经实施了临时的 llama.cpp 分支以实现本地支持。

  • 性能与成本:该模型处理复杂智能体任务(如代码考古和回归修复)的能力及其极低的成本被视为一大优势,一位用户报告一次复杂的 merge 和 fix 仅花费了 $0.45。

  • 量化:关于不同量化级别(如 IQ4_XS)的有效性正在进行讨论,部分用户观察到在使用高度压缩的量化版本时,性能相比于稠密型的 Qwen3.8-27B 模型有所下降。

Sources

相关