Qwen3.8-Flash-Next 發佈說明:Qwen4 架構預覽
Qwen3.8-Flash-Next 是一款多模態混合專家 (MoE) 模型,它在注意力機制、殘差流、嵌入層和優化方面引入了系統性的架構革新。作為 Qwen4 架構的早期預覽,它在程式碼編寫和辦公任務中的表現優於 Qwen3.7-Plus,且僅需 1/9 的訓練成本。
架構創新
Qwen3.8-Flash-Next 實施了四項主要的技術升級,以提高計算效率和模型容量。
混合注意力機制:GDN 與 QSA
為了在記憶體效率與精確檢索之間取得平衡,該模型採用了混合架構,其中每四層中有三層使用 Gated DeltaNet (GDN) 將歷史資訊壓縮成固定大小的狀態。其餘層則使用由 Qwen Sparse Attention (QSA) 增強的全域注意力機制。
QSA 通過使用輕量級索引器將序列聚合為 micro-blocks 來降低長序列計算的開銷。透過在區塊層級而非 token 層級估算重要性,QSA 最小化了索引成本。在 1M-token 的上下文長度下,QSA 在 prefill 階段實現了高達 7.6 倍的加速,在 decode 階段實現了 4.9 倍的加速。在 prefix cache 命中率為 90% 的場景下,其 prefill 吞吐量是 Qwen3.7-Plus 的 8.6 倍。
門控殘差 (GR) 流
為了防止深層網路中早期層特徵的稀釋,Gated Residual (GR) 將傳統的單一殘差流擴展為四個並行分支。一個動態的逐元素門控 (element-wise gate) 控制著資訊如何從這些分支中讀取與寫入。
這種設計允許模型維持從早期注意力層到深層層級的長程路徑。此外,GR 機制也抑制了激活值異常值 (activation outliers),提高了訓練穩定性,並支持 FP8 storage 以減少記憶體存取開銷。
用於可擴展容量的 N-gram Embedding
Qwen3.8-Flash-Next 結合了 N-gram Embedding,它根據局部上下文(當前 token 與前序 token)進行檢索,而非僅基於單一 token。這增加了一種「局部模式記憶」,在幾乎不增加每個 token 計算量的同時提升了模型容量。
除了 125B 的主模型參數外,該模型還包含 51B N-gram embedding 參數。為了避免 GPU 記憶體飽和,這些參數可以存儲在主機記憶體 (host memory) 中,並在模型計算期間進行非同步預取 (asynchronously prefetched)。
透過 Muon 進行優化
該模型使用 Muon optimizer 進行訓練,特別針對正交化精度和融合參數矩陣的拆分進行了優化。Muon 被應用於二維線性映射(Attention, GDN, 和 MoE Experts),而 AdamW 則保留用於 embeddings、MoE router 和 GR 低秩參數。
關鍵的優化發現包括:
- Scaling Law Refitting:新架構允許使用更大的學習率和 batch size。
- Batch Size Warmup:團隊發現直接使用目標 batch size 比起逐漸進行 warmup,效率更高,能將 optimizer steps 減少 18.8%。
模型規格與性能
Qwen3.8-Flash-Next 擁有 125B 參數的主模型,每個 token 激活 6B 參數。它原生支持 262,144 tokens 的上下文窗口,並可透過 YaRN 擴展至 1,000,000 tokens。
Benchmarks
在語言和程式碼任務中,Qwen3.8-Flash-Next 的表現優於多個競爭對手和之前的版本:
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash |
|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 |
在視覺語言任務中,該模型展現了強大的智能體 (agentic) 能力,特別是在 AndroidWorld (84.5) 和 OSWorld 2.0 (52.3 partial) 中,表現顯著超越了 Qwen3.7-Plus。
部署與定價
Qwen3.8-Flash-Next 可在 Hugging Face 和 ModelScope 上以開源權重模型的形式提供。生產版本 Qwen3.8-Flash 透過 QwenCloud 提供服務,定價如下:
- Input: 0.16 USD per million tokens
- Output: 0.47 USD per million tokens
社群洞察與技術討論
社群回饋強調了新架構的效率增益與硬體需求:
Hardware Constraints:使用者注意到 51B N-gram embedding 參數顯著增加了記憶體佔用。雖然 6B 的激活參數有助於記憶體頻寬,但總體大小使得對於記憶體小於 128GB 的使用者來說極具挑戰性。一位使用者指出:
"the 50B ngram sidecar makes it impossible... the new ngram architecture makes it pretty much unusable for regular folks who cant afford more than 32-64 GB ram."
Local Execution:早期採用者報告在 Ryzen 395 / Strix Halo 硬體上成功執行,達到約 22 tokens/s。部分使用者已實施了初步的
llama.cpp分支來實現本地支持。Performance vs. Cost:該模型處理複雜智能體任務(如程式碼考古學與回歸修復)的能力及其極低的成本被視為一大優勢,一位使用者報告一次複雜的 merge 與 fix 僅花費了 $0.45。
Quantization:目前正針對不同量化層級(例如 IQ4_XS)的有效性進行討論,部分使用者觀察到在使用高度壓縮的量化模型時,性能會比稠密 (dense) 的 Qwen3.8-27B 模型有所下降。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch