QwenLM/Qwen3.8-Flash-Next
Qwen3.8-Flash-Next is the foundation model developed by Qwen Team, Alibaba Group.
解決的問題
Qwen3.8-Flash-Next 是一款為最大化計算效率與訓練穩定性而設計的多模態混合專家(MoE)模型,同時在程式碼與辦公任務中保持高表現。它作為即將推出的 Qwen4 系列的早期架構預覽,引入了一種混合架構,相比先前的 Qwen3.7-Plus 版本,顯著降低訓練與推論成本。
工作原理
該模型在四個關鍵領域進行系統性升級:
- 注意力機制:採用混合 GDN + QSA 架構。門控 DeltaNet(GDN)負責高效的历史壓縮,而 Qwen 稀疏注意力(QSA)使用輕量級索引器在微塊級別選擇重要上下文,從而降低長序列的計算成本。
- 殘差結構:實現門控殘差(GR),將殘差流擴展為四個分支,並使用動態門控控制資訊流,提升穩定性。
- 嵌入層:採用 N-gram 嵌入,利用局部上下文以極小的計算開銷擴展模型容量;這些表可卸載至主機記憶體並異步預取。
- 優化器:採用 Muon 優化器,針對正交化精確度與特定參數拆分進行優化,並應用重新擬合的縮放定律。
適用對象
該模型適用於需要高容量模型(125B 參數,每 token 激活 6B)且運行與訓練成本低廉的開發者與研究人員,以及希望探究 Qwen4 架構演進的社群。
主要亮點
- 極致高效:訓練成本約為 Qwen3.7-Plus 的 1/9,同時在程式碼與辦公任務中表現更優。
- 多模態 MoE:結合多模態能力與混合專家架構。
- 支援 Hugging Face 與 ModelScope:權重可在兩個平台取得,便於整合。
- 廣泛部署支援:相容 SGLang、vLLM、llama.cpp 與 MLX,支援高效率推論。
相關
- 專案
- 專案
- 專案
- 專案