QwenLM/Qwen3.8-Flash-Next

Qwen3.8-Flash-Next is the foundation model developed by Qwen Team, Alibaba Group.

解決的問題

Qwen3.8-Flash-Next 是一款為最大化計算效率與訓練穩定性而設計的多模態混合專家(MoE)模型,同時在程式碼與辦公任務中保持高表現。它作為即將推出的 Qwen4 系列的早期架構預覽,引入了一種混合架構,相比先前的 Qwen3.7-Plus 版本,顯著降低訓練與推論成本。

工作原理

該模型在四個關鍵領域進行系統性升級:

  • 注意力機制:採用混合 GDN + QSA 架構。門控 DeltaNet(GDN)負責高效的历史壓縮,而 Qwen 稀疏注意力(QSA)使用輕量級索引器在微塊級別選擇重要上下文,從而降低長序列的計算成本。
  • 殘差結構:實現門控殘差(GR),將殘差流擴展為四個分支,並使用動態門控控制資訊流,提升穩定性。
  • 嵌入層:採用 N-gram 嵌入,利用局部上下文以極小的計算開銷擴展模型容量;這些表可卸載至主機記憶體並異步預取。
  • 優化器:採用 Muon 優化器,針對正交化精確度與特定參數拆分進行優化,並應用重新擬合的縮放定律。

適用對象

該模型適用於需要高容量模型(125B 參數,每 token 激活 6B)且運行與訓練成本低廉的開發者與研究人員,以及希望探究 Qwen4 架構演進的社群。

主要亮點

  • 極致高效:訓練成本約為 Qwen3.7-Plus 的 1/9,同時在程式碼與辦公任務中表現更優。
  • 多模態 MoE:結合多模態能力與混合專家架構。
  • 支援 Hugging Face 與 ModelScope:權重可在兩個平台取得,便於整合。
  • 廣泛部署支援:相容 SGLang、vLLM、llama.cpp 與 MLX,支援高效率推論。

相關

  • 專案
  • 專案
  • 專案
  • 專案