Qwen3.8-Flash-Next 發佈說明:Qwen4 架構預覽

Qwen3.8-Flash-Next 是一款多模態混合專家 (MoE) 模型,它在注意力機制、殘差流、嵌入層和優化方面引入了系統性的架構革新。作為 Qwen4 架構的早期預覽,它在程式碼編寫和辦公任務中的表現優於 Qwen3.7-Plus,且僅需 1/9 的訓練成本。

架構創新

Qwen3.8-Flash-Next 實施了四項主要的技術升級,以提高計算效率和模型容量。

混合注意力機制:GDN 與 QSA

為了在記憶體效率與精確檢索之間取得平衡,該模型採用了混合架構,其中每四層中有三層使用 Gated DeltaNet (GDN) 將歷史資訊壓縮成固定大小的狀態。其餘層則使用由 Qwen Sparse Attention (QSA) 增強的全域注意力機制。

QSA 通過使用輕量級索引器將序列聚合為 micro-blocks 來降低長序列計算的開銷。透過在區塊層級而非 token 層級估算重要性,QSA 最小化了索引成本。在 1M-token 的上下文長度下,QSA 在 prefill 階段實現了高達 7.6 倍的加速,在 decode 階段實現了 4.9 倍的加速。在 prefix cache 命中率為 90% 的場景下,其 prefill 吞吐量是 Qwen3.7-Plus 的 8.6 倍。

門控殘差 (GR) 流

為了防止深層網路中早期層特徵的稀釋,Gated Residual (GR) 將傳統的單一殘差流擴展為四個並行分支。一個動態的逐元素門控 (element-wise gate) 控制著資訊如何從這些分支中讀取與寫入。

這種設計允許模型維持從早期注意力層到深層層級的長程路徑。此外,GR 機制也抑制了激活值異常值 (activation outliers),提高了訓練穩定性,並支持 FP8 storage 以減少記憶體存取開銷。

用於可擴展容量的 N-gram Embedding

Qwen3.8-Flash-Next 結合了 N-gram Embedding,它根據局部上下文(當前 token 與前序 token)進行檢索,而非僅基於單一 token。這增加了一種「局部模式記憶」,在幾乎不增加每個 token 計算量的同時提升了模型容量。

除了 125B 的主模型參數外,該模型還包含 51B N-gram embedding 參數。為了避免 GPU 記憶體飽和,這些參數可以存儲在主機記憶體 (host memory) 中,並在模型計算期間進行非同步預取 (asynchronously prefetched)。

透過 Muon 進行優化

該模型使用 Muon optimizer 進行訓練,特別針對正交化精度和融合參數矩陣的拆分進行了優化。Muon 被應用於二維線性映射(Attention, GDN, 和 MoE Experts),而 AdamW 則保留用於 embeddings、MoE router 和 GR 低秩參數。

關鍵的優化發現包括:

  • Scaling Law Refitting:新架構允許使用更大的學習率和 batch size。
  • Batch Size Warmup:團隊發現直接使用目標 batch size 比起逐漸進行 warmup,效率更高,能將 optimizer steps 減少 18.8%。

模型規格與性能

Qwen3.8-Flash-Next 擁有 125B 參數的主模型,每個 token 激活 6B 參數。它原生支持 262,144 tokens 的上下文窗口,並可透過 YaRN 擴展至 1,000,000 tokens

Benchmarks

在語言和程式碼任務中,Qwen3.8-Flash-Next 的表現優於多個競爭對手和之前的版本:

Benchmark Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash
DeepSWE 1.1 58.7 42.2 16.5 54.4
SWE-bench Pro 62.5 61.7 55.8 56.0
CoWorkBench 73.9 70.7 65.1 45.1
GPQA Diamond 91.7 89.2 90.3 90.8
LiveCodeBench v6 91.9 90.3 89.6 90.6

在視覺語言任務中,該模型展現了強大的智能體 (agentic) 能力,特別是在 AndroidWorld (84.5)OSWorld 2.0 (52.3 partial) 中,表現顯著超越了 Qwen3.7-Plus。

部署與定價

Qwen3.8-Flash-Next 可在 Hugging Face 和 ModelScope 上以開源權重模型的形式提供。生產版本 Qwen3.8-Flash 透過 QwenCloud 提供服務,定價如下:

  • Input: 0.16 USD per million tokens
  • Output: 0.47 USD per million tokens

社群洞察與技術討論

社群回饋強調了新架構的效率增益與硬體需求:

  • Hardware Constraints:使用者注意到 51B N-gram embedding 參數顯著增加了記憶體佔用。雖然 6B 的激活參數有助於記憶體頻寬,但總體大小使得對於記憶體小於 128GB 的使用者來說極具挑戰性。一位使用者指出:

    "the 50B ngram sidecar makes it impossible... the new ngram architecture makes it pretty much unusable for regular folks who cant afford more than 32-64 GB ram."

  • Local Execution:早期採用者報告在 Ryzen 395 / Strix Halo 硬體上成功執行,達到約 22 tokens/s。部分使用者已實施了初步的 llama.cpp 分支來實現本地支持。

  • Performance vs. Cost:該模型處理複雜智能體任務(如程式碼考古學與回歸修復)的能力及其極低的成本被視為一大優勢,一位使用者報告一次複雜的 merge 與 fix 僅花費了 $0.45。

  • Quantization:目前正針對不同量化層級(例如 IQ4_XS)的有效性進行討論,部分使用者觀察到在使用高度壓縮的量化模型時,性能會比稠密 (dense) 的 Qwen3.8-27B 模型有所下降。

Sources

相關