Qwen3.8-2.4T-A95B 发布说明
Qwen3.8-2.4T-A95B 为开源版本带来了 Qwen-Max 级别的能力
Qwen3.8-2.4T-A95B 是 Qwen 开源模型家族中能力最强的版本,在编程、专业研究和长程智能体任务方面取得了实质性的进步。该模型基于 Qwen3.5 的架构基础构建,旨在以高可靠性和更强的自主规划能力处理复杂的、多步骤的任务。
模型架构与规格
Qwen3.8-2.4T-A95B 是一个因果语言模型(Causal Language Model),采用混合专家(MoE)架构,以平衡总参数量与推理效率。
核心技术规格
- 总参数量: 2.4 Trillion
- 激活参数量: 95 Billion
- 层数: 92
- 隐藏层维度: 8192
- 混合专家: 总计 512 个专家,每个 token 激活 10 个路由专家和 1 个共享专家。
- 专家中间层维度: 2048
- 上下文长度: 原生支持 262,144 tokens,可扩展至 1,010,000 tokens。
- 词表大小: 248,320 (padded)。
架构布局
该模型采用了 23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)) 的隐藏布局。它在 Gated DeltaNet 中拥有 128 个用于 V 的线性注意力头和 16 个用于 QK 的注意力头,在 Gated Attention 中拥有 64 个用于 Q 的注意力头和 4 个用于 KV 的注意力头。
性能基准
Qwen3.8-Max(基于此模型的官方版本)在面对 Claude Opus 4.8、Fable 5 和 GPT-5.6 Sol 等前沿模型时表现出了极具竞争力的性能。
编程与智能体性能
Qwen3.8-Max 相比 Qwen3.7-Max 有显著提升,尤其是在软件工程基准测试中:
- Terminal Bench 2.1: 86.6 (对比 Qwen3.7-Max 的 74.5)
- FrontierSWE: 73.5 (对比 Qwen3.7-Max 的 40.7)
- PaperBench: 93.0 (以 90.5 的成绩领先于 GPT-5.6 Sol)
- AndroidBench: 75.1 (对比 Qwen3.7-Max 的 56.5)
通用能力
- GPQA Diamond: 92.6,与 Fable 5 持平并超过了 Opus 4.8 (92.0)。
- IFBench: 82.8,优于 GPT-5.6 Sol (72.7) 和 Fable 5 (63.5)。
- MRCR v2 256K (8-needle): 92.9,展示了强大的长上下文检索能力。
部署与 API 使用
服务框架
Qwen3.8 兼容多种高吞吐量推理引擎:
- SGLang
- vLLM
- TokenSpeed
API 配置与推理控制
Qwen3.8-2.4T-A95B 是一个纯文本模型,所有交互都需要“思考模式”。每个响应都以包含在 <think> 标签中的推理过程开始。
用户可以通过 reasoning_effort 参数控制推理深度:
xhigh(默认): 适用于需要彻底分析的复杂任务。medium: 在准确性和速度之间取得平衡。low: 针对速度和成本进行了优化。
推荐采样参数
为了获得最佳效果,建议使用以下采样设置:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0。
社区见解与技术考量
社区讨论强调了开源权重版本与托管的 Qwen3.8-Max 服务之间的几个关键权衡。
硬件需求与量化
由于其 2.4T 的参数量,完整的 BF16 模型估计大小约为 4.9TB。社区成员指出,对于大多数用户来说,在不进行量化的情况下运行此模型成本极高。
"The 1bit quant model is at an astonishing 397GB... This literally puts Opus 4.5 performance level into a machine a normal person could buy."
功能差异
用户指出,开源权重版本缺少托管版 Qwen3.8-Max 中的一些功能,包括:
- 视觉支持: 开源权重模型仅限文本。
- 上下文窗口: 开源版本限制在 250k tokens,而托管版本默认支持 1M tokens。
- 非思考模式支持: 托管版本允许在没有强制推理阶段的情况下进行响应。
许可协议
该模型对内部使用或年收入低于 5000 万美元的实体免费。对于超过此阈值的实体,特别是针对编程或生产力智能体的服务,将受到限制。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch