Qwen3.8-Flash-Next 發佈說明 / 更新內容
Qwen3.8-Flash-Next 是一款多模態混合專家 (MoE) 模型,作為即將推出的 Qwen4 系列的架構預覽。它引入了混合 Gated DeltaNet (GDN) 與 Qwen Sparse Attention (QSA) 設計,以優化計算效率與模型容量,將訓練成本降低至約為 Qwen3.7-Plus 的 1/9,同時在程式碼編寫與辦公生產力任務中提供卓越的性能。
模型架構與技術創新
Qwen3.8-Flash-Next 在四個主要技術維度進行了系統性升級:注意力機制 (attention)、殘差流 (residual streams)、嵌入 (embeddings) 以及優化 (optimization)。
混合注意力機制:GDN 與 QSA
為了在記憶體效率與精確檢索之間取得平衡,該模型採用混合架構,其中每四層中有三層使用 Gated DeltaNet (GDN) 將歷史資訊壓縮成固定大小的狀態。其餘一層則採用由 Qwen Sparse Attention (QSA) 增強的全域注意力機制。
QSA 透過使用輕量級索引器將序列聚合為微區塊 (micro-blocks),從而降低長序列計算的開銷。它在區塊層級估算重要性並選擇相關區域進行注意力計算,從而降低了注意力成本與索引開銷。在 100 萬個 token 的上下文長度下,QSA 的注意力核心在 prefill 階段實現了高達 7.6 倍的加速,在 decode 階段實現了 4.9 倍的加速。
門控殘差 (GR)
為了防止深層網路中早期特徵的稀釋,Gated Residual (GR) 將傳統的單一殘差流擴展為四個並行分支。一個動態的逐元素門控 (element-wise gate) 控制著這些分支間資訊的讀取與寫入,強化了跨層資訊流並提升了訓練穩定性。殘差狀態也支援 FP8 儲存,以進一步降低記憶體存取開銷。
N-gram 嵌入
為了在不增加單個 token 計算量的狀況下擴展模型容量,Qwen3.8-Flash-Next 引入了 N-gram Embedding。此方法根據當前 token 與數個前導 token 進行查找,以代表常見短語與局部模式。模型包含 51B N-gram 嵌入參數,這些參數可以卸載 (offload) 到主機記憶體並進行非同步預取 (asynchronously prefetched),確保它們不會佔用永久的 GPU 記憶體。
透過 Muon 進行優化
該模型使用 Muon 優化器進行訓練,特別針對正交化準確度與融合參數矩陣的拆分進行了精煉。Muon 被應用於二維線性映射 (Attention, GDN, 與 MoE Experts),而 AdamW 則保留用於嵌入 (embeddings)、MoE 路由 (router) 以及 GR 中的低秩參數 (low-rank parameters)。這種協同設計允許使用更大的學習率與批次大小 (batch sizes),從來提高收斂效率。
模型規格與能力
Qwen3.8-Flash-Next 擁有 125B 參數的主模型,並額外配備 51B N-gram 嵌入,每個 token 會激活 6B 參數。
上下文窗口與性能
- 上下文支援: 原生支援 262,144 個 token,可透過 YaRN 擴展至 1,000,000 個 token。
- 效率: 在 prefix cache 命中率為 90% 的服務場景下,於 1M tokens 時,其 prefill 吞吐量達到 Qwen3.7-Plus 的 8.6 倍。
- 定價: 生產版本 (Qwen3.8-Flash) 的價格為每百萬輸入 token 0.16 USD,每百萬輸出 token 0.47 USD。
基準測試
在基礎模型比較中,Qwen3.8-Flash-Next-Base 在 14 項基準測試中的 8 項表現優於 Qwen3.8-27B-Base 與 Qwen3.7-Plus-Base,包括 MMLU-Pro, SuperGPQA, BBH, GSM8K, EvalPlus, SWEBench-Pretrain, MGSM, 與 MMMLU。
對於代理 (agentic) 與程式碼編寫任務,該模型展現了顯著的提升:
- DeepSWE 1.1: 58.7 (相較於 Qwen3.7-Plus 的 16.5)。
- SWE-bench Pro: 62.5 (相較於 Qwen3.7-Plus 的 55.8)。
- CoWorkBench: 73.9 (相較於 Qwen3.7-Plus 的 65.1)。
- LiveCodeBench v6: 91.9。
多模態與視覺語言性能
Qwen3.8-Flash-Next 展現了強大的多模態代理智能與通用感知能力:
- 多模態工具使用 (ClawEval-MM): 64.4 Pass@3。
- 行動裝置使用 (AndroidWorld): 84.5。 -電腦使用 (OSWorld 2.0): 19.4 Binary / 52.3 Partial。
- 長影片理解 (LVBench): 76.6。
- 視覺數學 (MathVision): 95.7 (含 CI)。
整合與可用性
權重已在 Hugging Face 與 ModelScope 上提供。該模型透過 QwenCloud 以 qwen3.8-flash 的名稱提供服務,並支援 OpenAI-compatible Chat Completions 與 Responses APIs,以及與 Anthropic-compatible 介面整合,以便直接與 Claude Code 等工具整合。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch