Qwen 3.8-Flash-Next 发布

Qwen 3.8-Flash-Next 引入下一代 Qwen4 架构

阿里巴巴发布了 Qwen 3.8-Flash-Next,这是一款多模态混合专家(MoE)模型。此次发布是即将推出的 Qwen4 模型系列架构进步的早期预览,使社区能够为完整系列的发布做好准备。

模型规格与可用性

Qwen 3.8-Flash-Next 计划于 2026 年 8 月 26 日 15:00 UTC 发布。此次发布包含模型的两个主要版本:

  • Qwen/Qwen3.8-Flash-Next:标准开源模型。
  • Qwen/Qwen3.8-Flash-Next-FP8:为提升效率而量化的版本。

尽管官方 ModelScope 页面的正文未明确列出参数量,但社区讨论表明其配置为 1250 亿总参数,其中 60 亿活跃参数(125B a6B)。

本地部署与硬件要求

Qwen 3.8-Flash-Next 的 MoE 架构使其成为高内存消费级硬件用户的理想选择。由于 MoE 模型在推理时仅激活其总参数的一小部分,因此只要拥有足够的 RAM/VRAM 来容纳模型权重,就有可能在本地设备上实现可用的运行速度。

社区成员已提出几种潜在的部署硬件配置:

  • 高内存系统:拥有 128GB RAM 的用户(如使用 Strix Halo 或 Mac Studio/M 系列 Max 芯片的用户)预计 4 位量化配合大上下文窗口将能顺利运行并高效执行。
  • 混合内存布局:部分用户报告通过将密集推理层放在 GPU 上、专家层放在 CPU 上,成功运行 MoE 模型,此前在 80B-a3B 模型上实现了高达每秒 40 个 token 的速度。
  • 推理优化:社区对本模型与 FreeToken 等推理引擎的结合表现出浓厚兴趣,这些引擎旨在优化 MoE 架构下 CPU/RAM 与 GPU/VRAM 之间的任务分配。

社区观点与市场定位

开发者和爱好者正在关注 Qwen 3.8-Flash-Next 与 DeepSeek v4 Flash 等其他高效率模型的对比。提前发布架构改进被视为一项战略性举措,旨在在 Qwen4 全面推出前提供社区预览。

一些开发者指出,通过 OpenRouter 等第三方提供商访问 Qwen 模型时存在稳定性和容量问题,表明尽管模型架构令人印象深刻,但可靠的 API 访问基础设施仍是部分用户的痛点。

"我非常喜欢 Qwen 模型,但通过 OpenRouter 构建基于它们的应用却很痛苦……很多 Qwen 模型几乎无法使用,或者极不稳定,你不得不在代码中大量添加提供方的黑名单/白名单。"

总体而言,此次发布被视为阿里巴巴在开源权重模型领域持续保持高速推进的信号,可能对编码和技术任务中专有模型的主导地位构成挑战。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch