Qwen3.8-Flash-Next 发布说明:Qwen4 架构预览
Qwen3.8-Flash-Next 是一款多模态混合专家 (MoE) 模型,它在注意力机制、残差流、嵌入层和优化方面引入了系统性的架构变革。作为 Qwen4 架构的早期预览版,它在编程和办公任务中的表现优于 Qwen3.7-Plus,而训练成本仅为后者的 1/9。
架构创新
Qwen3.8-Flash-Next 实施了四项主要的技术升级,以提高计算效率和模型容量。
混合注意力:GDN 与 QSA
为了在内存效率与精确检索之间取得平衡,该模型采用了混合架构,其中每四层中有三层利用 Gated DeltaNet (GDN) 将历史信息压缩为固定大小的状态。其余层则使用由 Qwen Sparse Attention (QSA) 增强的全局注意力机制。
QSA 通过使用轻量级索引器将序列聚合为 micro-blocks 来降低长序列计算的开销。通过在块级别而非 token 级别评估重要性,QSA 最小化了索引成本。在 1M-token 上下文长度下,QSA 在 prefill 阶段实现了高达 7.6 倍的加速,在 decode 阶段实现了 4.9 倍的加速。在具有 90% 前缀缓存命中率的场景下,其 prefill 吞吐量是 Qwen3.7-Plus 的 8.6 倍。
门控残差 (GR) 流
为了防止深层网络中早期层特征的稀释,Gated Residual (GR) 将传统的单残差流扩展为四个并行分支。一个动态的逐元素门控控制着信息如何从这些分支中读取和写入。
这种设计允许模型维持从早期注意力层到深层层的长程路径。此外,GR 机制抑制了激活值离群点,提高了训练稳定性,并支持 FP8 storage 以减少内存访问开销。
用于可扩展容量的 N-gram 嵌入
Qwen3.8-Flash-Next 结合了 N-gram Embedding,它基于局部上下文(当前 token 和前序 token)而非单个 token 进行查找。这增加了一种“局部模式记忆”,在几乎不增加单 token 计算量的情况下提升了模型容量。
除了 125B 的主模型参数外,该模型还包含 51B N-gram embedding 参数。为了避免 GPU 显存饱和,这些参数可以存储在主机内存中,并在模型计算期间进行异步预取。
通过 Muon 进行优化
该模型使用 Muon 优化器 进行训练,该优化器专门针对正交化精度和融合参数矩阵的分离进行了优化。Muon 被应用于二维线性映射(Attention、GDN 和 MoE Experts),而 AdamW 则保留用于嵌入层、MoE router 和 GR 低秩参数。
关键优化发现包括:
- Scaling Law 重新拟合:新架构允许使用更大的学习率和 batch size。
- Batch Size 预热:团队发现直接使用目标 batch size 比逐步预热更有效,相比逐步预热减少了 18.8% 的优化器步数。
模型规格与性能
Qwen3.8-Flash-Next 拥有 125B 参数的主模型,每个 token 激活 6B 参数。它原生支持 262,144 tokens 的上下文窗口,并可通过 YaRN 扩展至 1,000,000 tokens。
基准测试
在语言和编程任务中,Qwen3.8-Flash-Next 的表现优于多个竞争对手和之前的版本:
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash |
|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 |
在视觉语言任务中,该模型展示了强大的智能体 (agentic) 能力,特别是在 AndroidWorld (84.5) 和 OSWorld 2.0 (52.3 partial) 中,表现显著超过了 Qwen3.7-Plus。
部署与定价
Qwen3.8-Flash-Next 作为开源权重模型可在 Hugging Face 和 ModelScope 上获取。生产版本 Qwen3.8-Flash 通过 QwenCloud 提供服务,定价如下:
- Input: 0.16 USD per million tokens
- Output: 0.47 USD per million tokens
社区洞察与技术讨论
社区反馈突出了新架构的效率提升以及硬件要求:
硬件约束:用户指出 51B N-gram embedding 参数显著增加了内存占用。虽然 6B 的激活参数有助于缓解内存带宽压力,但总容量使得对于内存小于 128GB 的用户来说极具挑战。一位用户指出:
"the 50B ngram sidecar makes it impossible... the new ngram architecture makes it pretty much unusable for regular folks who cant afford more than 32-64 GB ram."
本地执行:早期采用者报告在 Ryzen 395 / Strix Halo 硬件上成功运行,速度约为 22 tokens/s。一些用户已经实施了临时的
llama.cpp分支以实现本地支持。性能与成本:该模型处理复杂智能体任务(如代码考古和回归修复)的能力及其极低的成本被视为一大优势,一位用户报告一次复杂的 merge 和 fix 仅花费了 $0.45。
量化:关于不同量化级别(如 IQ4_XS)的有效性正在进行讨论,部分用户观察到在使用高度压缩的量化版本时,性能相比于稠密型的 Qwen3.8-27B 模型有所下降。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch