Qwen3.8-Max 发布:2.4T 参数模型,开放权重及自主编码提升
概览
Qwen3.8-Max 是 Qwen 系列迄今为止最强大的模型,参数规模达 2.4 万亿,其中激活参数 950 亿,也是首个将权重开源的 Qwen‑Max‑class 模型(发布计划为下周)。该模型在编码、真实工作、科研及长周期任务方面实现全面提升,能够在最少人工干预的情况下完成复杂目标的端到端执行。
编码能力
Qwen3.8-Max 能够在无人干预的情况下,从零开始自主驱动多天软件项目直至完成。在一次 10+ 天的运行中,它构建了 oh-my-cli 自演进框架,截至 2026 年 7 月 30 日累计提交 265 次,拉取请求 127 次,问题 151 个。该框架融合了问题状态机、调度器、监控器和看门狗;每次更新后会触发构建、单元测试、端到端及桌面生命周期验证,并将异常状态路由回相关问题/PR 进行修复。它还通过将社区反馈和自测结果转化为可执行工作来自我演进,持续优化 /goal、/resume、动态工作流、会话回放和桌面等能力。
在另一项实验中,Qwen3.8-Max 从零开始复现论文《Unified Data Selection for LLM Reasoning》,并在此基础上进行改进。在约 5 天内,它编写了约 7,600 行代码,运行了 33 次 GPU 训练轮次,复现了论文的六项主要发现,在 AIME24 上相较于随机数据选择提升了 +7.7%。通过自我演进的研究循环,它在四轮中测试了 18 个想法,最终提出了一种计算难决策点(“nhighgate”)的方法,在 AIME24 上比论文方法提升了 +2.7 分。
Qwen3.8-Max 还参加了阿里巴巴云天平台上的 WWW2025 多模态对话意图识别挑战赛,共有 526 支人类团队参赛。在 24 小时限制下自主运行,它构建了一个方案:对文本进行微调并集成 BERT、MacBERT 和 RoBERTa;对截屏使用基于 Chinese‑CLIP 的 Qwen2.5‑VL‑7B 微调;再通过交叉验证校准的加权投票系统融合三者。其准确率从 0.60 提升至 0.853(共 45 次提交),击败了 526 支团队中的 458 支(占总体的 87%)。
这三个案例表明,Qwen3.8-Max 能够在几天内专注于开放式目标,自行生成假设并将其转化为可工作的成果,全程无需人工干预。
工作能力
除了编码,Qwen3.8-Max 还被训练用于处理构成真实工作的异构、工具密集型工作流。扩展真实世界强化学习(RL)系统涉及三个耦合挑战:(1)在任务、工作空间和框架轴上持续扩展解耦的真实环境,使增长呈组合复合;(2)构建一个统一的奖励体系,融合基于执行的检查、基于规则的文本和视觉输出裁决,以及在可自动扩展规则下的代理检查;(3)采用在线数据平衡器,使每个批次在任务、难度、工作空间和框架上高度平衡,抑制批间梯度方差并实现稳定的 RL 扩展。
因此,Qwen3.8-Max 在 RL 训练规模扩大时,在数十个内部和公开的工作基准上表现出稳定且一致的提升,并在 QwenWork、Claude Code、Codex、OpenClaw 和 Hermes 等框架上达到相当的性能。
对数百个高价值职业的广泛测试得出以下代表性结果:
- 企业合规顾问:在一小时内从数百份文件中筛选出 1,284 条相关条款,而法律助理团队需要一周。
- UI/UX 设计师:一次性完成 NOVA 银行应用的 8 屏高保真交互原型,零修改轮次,而传统方式需 3–5 轮。
- 餐饮品牌创始人:一 pass 生成含热量和食材来源的 26 道菜单,食品成本比保持在 33.8%,而传统迭代测试需数周。
- 结构工程师:在浏览器中重建 30 层办公楼的抗震模型,自然周期、基底剪切和层间漂移比可通过悬停查看,而专业软件需超过一周。
- 康复治疗师:将 2D 纸质评估转变为带可旋转视图和解剖叠加的 3D 交互演示,取代医学动画工作室的 2–4 周、千美元流程。
- 运动数据分析师:将每名球员约 8,400 次进攻/防守回合解析为战术档案和教练报告,仅需数分钟,而传统团队需数天。
Qwen3.8-Max 在定量研究方面也展现了深度:从六个短因子家族描述中衍生出约 330 个子代理,运行约 6,000 次回测并持续调整工作流。精选因子实现了 0.64–1.48 的超额夏普比率,信息系数在 0.010–0.014 范围内均为正值。模型动态剪除过拟合因子,加入多种子并集验证以消除路径依赖,并在集成效果不佳时切换至更稳健的合成策略。
这些例子说明 Qwen3.8‑Max 能够在多样化的专业工作流中交付生产级结果,常常将人类数周的工作压缩至一次自主会话。
长周期任务表现
Qwen3.8‑Max 在需要数千轮交互的任务上表现出强大的系统级自主规划和闭环自适应学习能力。
在自主芯片设计中,模型独立完成了 GCD/RSA 加密硬件加速器的全套硅流程。从一个空白 RTL 工作区开始,它在 13 个里程碑上执行了 500 轮交互和 71 次评估,将门数从 8,298 减少到 678(芯片面积降低 81%),并在 500 MHz 时实现时序闭合,余量为 +0.66 ns。关键里程碑包括:用迭代移位减法架构替换 16 位硬件模数除法器(节省 6,288 个门)、消除冗余、裁减位宽、修剪控制 FSM、融合模块,以及应用门级优化,如共享 NOR‑gate 树和绝对差分拆分。通过 OpenROAD 进行的物理实现证实,前端优化直接转化为紧凑且可布线的硅。
在 365 天的电子商务基准仿真中,Qwen3.8‑Max 初始资本为 ¥100,000,面对包含 152 家欺诈商家的供应商矩阵,并在现实季节性冲击下管理库存、定价、退货和现金流。它在价格谈判中实现持续学习,谈判效率随时间提升并将收益推广至类似产品。模型早期大举投资以建立市场地位,最终在年末促销期间实现净利润超过 ¥100,000——几乎是第二名 GLM 5.2 的 2.4 倍。年末总余额达到 ¥416,252(即 4.16 倍回报),超越 GLM 5.2 38%,且较其前身 Qwen3.7‑Max 提升 152%。这些结果凸显了 Qwen3.8‑Max 在超过 2,000 轮交互反馈中进行长周期连贯决策和自适应学习的能力。
多模态代理能力
Qwen3.8‑Max 将视觉视为贯穿规划、执行、验证和迭代的原生反馈回路。它能够理解并生成跨越图像、文档以及超过 100 小时的视频的内容,构建连接人物、事件、时间戳和场景的视频记忆图。在执行过程中,它会持续检查中间结果——页面布局、对象方向、空间关系、动画质量和交互结果——并在检测到不匹配时自主修改计划。
该模型还支持混合代理工作流,将代码生成与 GUI 操作配对。在 RecreationBench 基准(覆盖 Ubuntu、macOS、Windows、Android 和网页)中,Qwen3.8‑Max 通过与黑盒二进制交互,在编码和 GUI 反馈循环中从零重建应用。为便于集成,实验室发布了 Qwen‑MM‑Plugins,这是一个提供图像/视频处理、多模态内存、动态分辨率支持、可视化工具使用以及视频编辑、Blender 和 CAD 专用能力的框架扩展。
部署与访问
Qwen3.8-Max 可通过 QwenCloud 使用。API 包含一个 reasoning_effort 参数,具有三个级别:
xhigh(默认):用于需要深入分析的复杂任务medium:在准确性和速度之间取得平衡low:优先考虑速度和成本preserve_thinking默认启用,以获得最佳开箱即用体验。
源码中提供了通过 OpenAI‑compatible 端点调用模型的示例代码,演示如何设置 model="qwen3.8-max"、启用思考并流式返回响应。
该模型与流行的代理框架和编程助手集成:
- Claude Code:设置
ANTHROPIC_MODEL="qwen3.8-max"并指向 QwenCloud 基础 URL。 - Codex:在
~/.codex/model-catalog.local.json中添加模型条目,设置context_window为 1,000,000 并支持低/中/xhigh 推理级别。 - Qoder CLI:通过提供的脚本安装并运行
qoder。 - Qwen Code:安装
@qwen-code/qwen-code@latest并运行qwen。 - OpenClaw:配置
~/.openclaw/openclaw.json以使用 QwenCloud 兼容模式端点。
模型权重将在公告后的一周在 Hugging Face 和 ModelScope 上开源。
社区反应(来自 Hacker News 评论)
评论者指出了几个值得关注的点:
- 有人指出即将发布的 Qwen3.8‑27B 密集模型可能对本地推理具有重要意义,一位用户表示 "Qwen3.8‑27B 是这里的真正新闻。" ([@boredatoms])
- 一位用户提到预览版(Qwen3.8‑Max‑Preview)自 7 月 19 日起已在阿里巴巴的 Token Plan、Qoder 和 QoderWork 上可用,质疑 8 月 3 日的公告增加了什么。 ([@simonw])
- 关于成本的讨论:
reasoning_effort选项被提及为控制费用的方式,一位评论者希望它能 "显著更便宜" 于替代方案。 ([@ddxv]) - 对于是否模型的自演进行为涉及从其他模型蒸馏的猜测,例如 "这意味着他们蒸馏了 Claude 吗?" ([@choppaface])
- 对首个开放权重的 Qwen‑Max‑class 模型的热情,被形容为 "Nice!" ([@wxw]) 和 "开源社区可能需要集体 GoFundMe 才能买够 VRAM 来托管这个怪兽。" ([@khanhnguyen8386])
- 关于在本地运行模型的实际担忧,包括硬件需求(一位用户指出 2080 Ti 在运行 27B 密集模型时会吃力)以及需要大量 VRAM 来托管 2.4 T‑参数版本。 ([@aliljet], [@khanhnguyen8386])
- 对将模型扩展到视频/图像生成的兴趣,询问是否会发布任何视频或图像生成功能。 ([@SXX])
- 一些用户对新颖性表示怀疑,指出基准提升相比之前模型显得增量。 ([@HarHarVeryFunny])
- 少数评论者对数据保留政策表示担忧,要求澄清 QwenCloud 是否将 API 输入用于训练。 ([@Aldipower])
这些社区见解反映了对开放权重发布的兴奋、对成本和可访问性的好奇,以及对模型实际实用性和局限性的持续讨论。
基准亮点
该帖子包含一份详细的基准表,将 Qwen3.8‑Max 与 Opus4.8、Fable5、GPT5.6 Sol(max)和 Qwen3.7‑Max 进行比较。精选结果:
- 编码代理:Terminal Bench 2.1 86.6 %(相比 Qwen3.7‑Max 的 74.5 %),SWE‑bench Pro 67.7 %(相比 60.6 %),DeepSWE 1.1 56.6 %(相比 21.6 %),PaperBench 93.0 %(相比 64.8 %),QwenSWEBench 80.7 %(相比 63.4 %)。
- 通用代理:CoWorkBench 74.8 %(相比 64.6 %),WorkSpaceBench 67.7 %(相比 61.4 %),JobBench 53.4 %(相比 31.3 %),SkillsBench 70.2 %(相比 61.2 %)。
- 通用能力:GPQA Diamond 92.6 %(相比 92.4 %),IFBench 82.8 %(相比 79.1 %),HealthBench 60.2 %(相比 54.5 %),PLawBench 73.2 %(相比 58.9 %)。
- 长上下文:MRCR v2 256K 92.9 %(相比 86.7 %),LongBench v2 66.3 %(相比 65.3 %)。
- 多模态推理:MMMU‑Pro 82.3 %(相比 79.0 %),MathVision 95.2 / 97.7(相比 90.3 / --),BabyVision 82.0 / 91.3(相比 64.7 / 70.4),HiPhO 90.0 %(相比 84.1 %)。
- 视觉代理 & 编码:OSWorld‑Verified 86.1 %(相比 73.3 %),AndroidWorld 85.3 %(相比 81.0 %),Parametric CAD Bench 91.5 %(相比 73.8 %)。
- 文档 & 办公智能:CharXiv (RQ) 88.4 / 93.5(相比 85.8 / 85.9),OmniDocBench 1.5 92.1 %(相比 91.4 %)。
- 真实世界 & 空间理解:RealWorldQA 88.0 %(相比 86.9 %),ERQA 77.8 %(相比 69.8 %)。
- 视频智能 & 代理:VideoMME (w/ Sub.) 90.4 %(相比 88.0 %),VideoMMMU 88.7 %(相比 85.4 %)。
这些数据说明 Qwen3.8‑Max 在编码、通用代理、多模态推理和长上下文任务方面相较于其前身及竞争模型的进步。
展望
Qwen3.8‑Max 通过结合巨大规模与开放权重、在编码和科研中的强大自演进循环,以及在多样化专业工作流中的 proven 熟练度,为自主、长周期 AI 代理设立了新基准。即将发布的 2.4 T‑参数权重以及更小的 27B 密集变体将促进更广泛的实验,而提供的 API 和框架集成旨在降低构建代理系统的门槛。持续的社区反馈将是评估真实世界可用性、成本效益以及潜在扩展(如视频或图像生成能力)的关键。