QwenLM/Qwen3.8-Flash-Next

Qwen3.8-Flash-Next is the foundation model developed by Qwen Team, Alibaba Group.

解决的问题

Qwen3.8-Flash-Next 是一个为最大化计算效率和训练稳定性而设计的多模态混合专家(MoE)模型,同时在编码和办公任务中保持高性能。它作为即将推出的 Qwen4 系列的早期架构预览,引入了一种混合架构,相比之前的 Qwen3.7-Plus 版本,显著降低了训练和推理成本。

工作原理

该模型在四个关键领域进行了系统性升级:

  • 注意力机制:采用混合 GDN + QSA 架构。门控DeltaNet(GDN)负责高效的历史压缩,而 Qwen 稀疏注意力(QSA)使用轻量级索引器在微块级别选择重要上下文,从而降低长序列的计算成本。
  • 残差结构:实现门控残差(GR),将残差流扩展为四个分支,并使用动态门控控制信息流,提升稳定性。
  • 嵌入层:采用 N-gram 嵌入,利用局部上下文以极小的计算开销扩展模型容量;这些表可卸载至主机内存并异步预取。
  • 优化器:采用 Muon 优化器,针对正交化精度和特定参数拆分进行了优化,并应用了重新拟合的缩放定律。

适用人群

该模型适用于需要高容量模型(125B 参数,每 token 激活 6B)且运行和训练成本低廉的开发者与研究人员,以及希望探究 Qwen4 架构演进的社区。

主要亮点

  • 极致高效:训练成本约为 Qwen3.7-Plus 的 1/9,同时在编码和办公任务中表现更优。
  • 多模态 MoE:结合多模态能力与混合专家架构。
  • 支持 Hugging Face 与 ModelScope:权重可在两个平台获取,便于集成。
  • 广泛部署支持:兼容 SGLang、vLLM、llama.cpp 和 MLX,支持高性能推理。

相关

  • 项目
  • 项目
  • 项目
  • 项目