Qwen 3.8-Flash-Next 發佈
Qwen 3.8-Flash-Next 引入次世代 Qwen4 架構
Alibaba 正準備發佈 Qwen 3.8-Flash-Next,這是一款多模態混合專家 (MoE) 模型。此次發佈作為即將推出的 Qwen4 模型家族架構進步的早期預覽,讓社群能夠為完整家族的發佈做好準備。
模型規格與可用性
Qwen 3.8-Flash-Next 預計於 2026 年 8 月 26 日 15:00 UTC 發佈。此次發佈包含模型的兩個主要版本:
- Qwen/Qwen3.8-Flash-Next: 標準開源模型。
- Qwen/Qwen3.8-Flash-Next-FP8: 為了提高效率而進行量化的版本。
雖然 ModelScope 官方頁面在正文中未明確列出參數數量,但社群討論指出其配置為 125B 總參數,其中 6B 為啟動參數 (125B a6B)。
本地部署與硬體需求
Qwen 3.8-Flash-Next 的 MoE 架構使其成為高記憶體消費級硬體使用者的目標。由於 MoE 模型在推理時僅啟動其總參數的一小部分,如果提供足夠的 RAM/VRAM 來容納模型權重,它們在本地機器上潛在可以達到可用的速度。
社群成員強調了幾種用於潛在部署的硬體配置:
- 高 RAM 系統: 使用 128GB RAM 的使用者(例如使用 Strix Halo 或 Mac Studio/M-series Max 晶片的使用者)預期 4-bit 量化版本搭配大上下文窗口將能容納並高效運行。
- 混合記憶體佈局: 一些使用者回報透過將密集推理層放置在 GPU 並將專家層放置在 CPU 上,成功運行 MoE 模型,在之前的 80B-a3B 模型上達到了每秒高達 40 個 token 的速度。
- 推理優化: 對於此模型與 FreeToken 等推理引擎的結合點展現出極大的興趣,這些引擎旨在優化 MoE 架構在 CPU/RAM 與 GPU/VRAM 之間的任務分配。
社群觀點與市場定位
開發者與愛好者正在關注 Qwen 3.8-Flash-Next 與其他高效率模型(特別是 DeepSeek v4 Flash)的比較。架構改進的早期發佈被視為在完整 Qwen4 推送之前提供社群預覽的策略性舉動。
一些開發者指出,透過 OpenRouter 等第三方提供商存取 Qwen 模型時,在穩定性與容量方面存在挑戰,這表明雖然模型架構令人印象深刻,但對於某些使用者而言,可靠的 API 存取基礎設施仍是一個痛點。
"I enjoy the Qwen models a lot, but building things on top of them with OpenRouter has been painful... many Qwen models have almost no capacity or is so flaky you literally have to just litter your code with a blacklist/whitelist of providers."
整體而言,此次發佈被視為 Alibaba 在開源權重模型領域持續積極進取的信號,可能會挑戰專有模型在程式碼編寫與技術任務中的主導地位。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch