Qwen3.8-Max 发布:2.4T‑参数模型,下周开放权重,以及广泛的自主能力

Qwen3.8‑Max 概览

Qwen3.8‑Max 是迄今为止 Qwen 系列中最强大的模型,规模达到 2.4 万亿参数(95 B 活跃),在编码、工作、研究和长时任务方面实现了全面提升。此次发布标志着 Qwen‑Max 级模型首次开放权重,权重将于下周开源。

编码能力

自主自我进化 harness

Qwen3.8‑Max 被指派从零构建 oh‑my‑cli 项目,并在 10+ 天 长时自主编码运行中构建了一个自我进化的 harness,该 harness 持续融合用户反馈、社区实践和自测结果。截至 2026 年 7 月 30 日,在大约 16 天 的完全自主运行后,仓库累计提交 265 次,拉取请求 127 次,问题 151 个【...】。

该 harness 的关键要素包括问题状态机、调度器、监控器和看门狗,形成执行循环;自测将异常状态路由回相关问题/拉取请求;以及多源进化,将社区经验和反馈转化为可执行的工作。

复现并改进一篇论文

给定论文 “Unified Data Selection for LLM Reasoning” (arXiv:2605.22389) 以及仅一组 GPU,Qwen3.8‑Max 花费约 五天(~125 小时)编写约 7,600 行代码,进行 33 轮 GPU 训练,复现了论文的六个主要发现。随后,它在接下来约 88 小时 进入自我改进研究循环,测试 18 项改进想法,分四轮进行。最终方法——计算硬决策点(“nhighgate”)——在 AIME24 基准上相比论文基线实现了 +2.7 分 的提升【...】。

在 24 小时竞赛中击败人类团队

在 WWW2025 多模态对话意图识别挑战赛(托管在阿里巴巴云的 Tianchi 平台)中,有 526 支人类团队,Qwen3.8‑Max 在严格的 24 小时 限制下自主运行。它构建了一个解决方案,对文本进行 BERT、MacBERT 和 RoBERTa 的微调与集成,并使用由 Chinese‑CLIP 支持的 Qwen2.5‑VL‑7B 视觉语言模型处理截图,通过加权投票系统融合。在 45 次提交 中,其准确率从 0.60 提升至 0.853,击败了 526 支团队中的 458 支(占比 87 %)【...】。

这三个案例展示了 Qwen3.8‑Max 在几天内专注于开放式目标、自行生成想法并将其转化为可工作成果的能力,全程无需人工干预。

实际工作能力

扩展真实世界 RL 系统

Qwen3.8‑Max 的工作能力通过联合扩展 RL 环境和计算得到提升。解决了三个耦合挑战:

  1. 沿独立轴持续扩展解耦的真实环境——任务(单任务 → 多任务 → 多天)、工作区(多文件 → 层次结构 → 复杂异构文件夹)和 harness(类别、版本、技能),使环境增长呈组合复合。
  2. 一个通用奖励系统,内部异质验证(基于执行的检查、基于 rubric 的文本/视觉输出裁决、代理式检查)在可自动扩展的 rubric 下统一。
  3. 在线数据均衡器,使每个批次在任务、难度、工作区和 harness 上的分布高度平衡,抑制批间梯度方差并维持稳定的 RL 计算扩展。

这些共同提供广度、可靠奖励和稳定性,从而在真实世界工作能力上实现可测量的横向提升。

跨越数百种职业的广度

压力测试表明,Qwen3.8‑Max 在许多高价值职业的真实工作流程中能够交付生产质量的结果:

  • 企业合规顾问:在不到一小时内从数百份文档中检索出 1,284 条相关条款,而法律助理团队通常需要一周。
  • UI/UX 设计师:一次性生成数字银行应用 NOVA(8 屏)的高保真交互式原型,零轮人工修订,而常规流程需要 3–5 轮。
  • 餐饮品牌创始人:阅读超过一百份原料供应简报,一次性生成完整的 26 菜单,每道菜标注平均热量和原料来源,食品成本比保持在 33.8 %
  • 结构工程师:在浏览器中重建 30 层办公楼的抗震结构模型,自然周期、基底剪切和层间漂移比可在悬停时查看,而此任务在专业软件中通常需要超过一周。
  • 康复治疗师:将 2D 纸质评估表转换为可自由旋转视角和逐层解剖叠加的 3D 交互式演示,此任务以前需要外包给医学动画工作室,周期为 2–4 周且成本数千美元。
  • 体育数据分析师:将每名球员约 8,400 次进攻/防守回合 解析为可直接使用的球员战术档案和教练报告,仅需数十分钟,而传统分析团队通常需要数个工作日。

在单次会话中构建盈利的端到端量化策略

得益于其 Dynamic Workflows 构建能力,Qwen3.8‑Max 能将一次对话转化为端到端量化研究循环。从一行任务描述出发,它自主规划复杂的动态工作流,构建数据系统,构建基础因子,并协调多轮贪婪迭代,同时动态分析回测并纠正航向。它还实现了因子挖掘的并行化:从六个经典因子家族的简短描述出发,将每个分解为 50 个研究方向,调度约 330 个子代理,完成约 6,000 次回测,并在运行过程中持续调整工作流。精选因子实现了 0.64–1.48 的超额夏普比率,IC 均为正数,范围为 0.010 至 0.014【...】。

长时任务表现

自主芯片设计与闭环优化

Qwen3.8‑Max 独立完成了 GCD/RSA 加密硬件加速器的完整硅设计流程。从最小输入——任务描述、一个 stub RTL 工作区和一个评估脚本——开始,它完全自主地运行,管理 RTL 编辑、仿真调试、综合分析、冗余定位以及迭代数据路径重构。在一次连续运行中,它完成了大约 500 次操作和 71 次评估,覆盖 13 个关键里程碑,将合成门数从 8,298 门 减少到 678 门(物理芯片面积减少 81 %),同时在 500 MHz 下实现时序闭合(+0.66 ns 余量)【...】。

关键里程碑包括:

  • 算法重写:模数除法器 → 迭代移位减法(8,298 → 2,010 门,第 22 次操作)。
  • 冗余消除 & 位宽修剪(2,010 → 1,304 门,第 35–48 次操作)。
  • 寄存器 & 控制 FSM 修剪(1,304 → 907 门,第 60–113 次操作)。
  • 模块融合 & 逻辑共享(907 → 765 门,第 170–252 次操作)。
  • 门级精炼(765 → 678 门,第 443–500 次操作)。

通过 OpenROAD 进行的物理布局验证显示,芯片面积从 106×106 µm² 缩小至 46×46 µm²,线长从 33,369 µm 减少到 4,187 µm,并成功实现时序闭合。

长期运营中的持续学习(电子商务基准)

在 365 天的电子商务运营模拟基准中,Qwen3.8‑Max 初始资本为 ¥100,000,需要在 12 种店铺类型、60 个产品类别、近 600 家供应商和 7,000 种产品之间管理产品选择、供应链谈判、库存、动态定价和退货处理。它在供应商谈判中展示了持续学习,实现了逐步降价和稳定利润增长,导致谈判效率随时间扩大。它还将此经验推广到类似产品,而其他模型则出现了平台期。

面对隐藏风险(供应商矩阵中嵌入的 152 家欺诈商家)和季节性需求波动,Qwen3.8‑Max 在早期大举投资,加速其资产增长曲线,并在年末大促期间实现净利润超过 ¥100,000——几乎是第二名 GLM 5.2 的 2.4 倍。最终它达到最高总余额 ¥416,252(4.16× 收益),超越 GLM 5.2 38 %,相比其前旗舰 Qwen3.7‑Max 提升 152 %【...】。

多模态代理与视觉反馈循环

Qwen3.8‑Max 将视觉视为规划、执行、验证和迭代中的原生反馈循环。它能够理解和生成视觉内容,检查自身的中间结果,检测偏差(例如电视朝错方向、界面错位),并自主修订计划并纠正输出。

此能力使得混合代理行为成为可能:将编码(高效、可扩展的重型工作)与 GUI 操作(触及人类能看到和触摸的内容)结合,以针对真实运行的应用程序进行验证。

为衡量此能力,RecreationBench 基准覆盖五个平台(桌面 Ubuntu/macOS/Windows、移动 Android 和 Web)。模型仅将真实运行的应用程序视为黑箱——无源代码、无互联网访问——必须通过反复的迭代编码和交互式反馈从零重建整个应用程序。Qwen3.8‑Max 已在此基准上展示了前沿水平的混合代理能力【...】。

为了更易集成,Qwen‑MM‑Plugins 提供了一个 harness 扩展库,提供图像和视频处理、多模态内存、动态分辨率支持、视觉工具使用,以及针对视频编辑、Blender 和 CAD 等任务的专门能力。任何现有的 agent harness 都可扩展为更原生的多模态系统。

用户反馈与社区反响

Hacker News 讨论中的评论指出了几个要点:

  • 有人指出 Qwen3.8‑27B 下周开放权重的公告意义重大,有评论称这是“真正的新闻”【...】。
  • 部分用户指出 Qwen3.8‑Max‑Preview 已在阿里巴巴的 Token Plan、Qoder 和 QoderWork 上于 7 月 19 日 首次亮相,质疑 8 月 3 日的公告新增了什么【...】。
  • 对成本和效率产生好奇:模型支持 reasoning_effort 参数(xhighmediumlow)以调整推理深度和控制成本,期望它将显著低于替代方案【...】。
  • 有少数评论者表示在 modest 硬件上本地运行 27B 模型存在困难,指出 GPU 内存限制【...】。
  • 有关 token 和推理效率的问题被提出,请求提供基准中的 token 使用数据【...】。
  • 模型的视觉能力受到赞赏,但有人指出在用于可视化 Web 开发任务时会出现超时问题【...】。
  • 讨论涉及更广泛的影响:开放权重模型禁令窗口可能变窄、模型在蒸馏输出中可能存在亲西方偏见、以及模型是否可被剥离为语言特定变体以实现更轻的本地使用【...】。
  • 多位用户表达了对将 Qwen3.8‑Max 与 Claude Code、Codex、Qoder CLI、Qwen Code 和 OpenClaw 等 agent 框架集成的兴奋,并分享了示例配置片段【...】。

可用性与使用

Qwen3.8‑Max 可通过 QwenCloud 访问:https://www.qwencloud.com/。模型权重将在下周在 Hugging Face 和 ModelScope 上开源。

API 使用

官方 API 支持 reasoning_effort 参数以在深度和成本之间进行权衡:

  • xhigh(默认):用于需要深入分析的复杂任务
  • medium:在准确度和速度之间取得平衡
  • low:优化速度和成本

preserve_thinking 默认启用,以获得最佳开箱即用体验。

使用 OpenAI‑兼容客户端的示例调用:

from openai import OpenAI
import os
api_key = os.environ.get("DASHSCOPE_API_KEY
if not api_key:
    raise ValueError("DASHSCOPE_API_KEY is required. Set it via: export DASHSCOPE_API_KEY='your-api-key'
)
client = OpenAI(
    api_key=api_key,
    base_url=os.environ.get(
        "DASHSCOPE_BASE_URL",
        "https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
    ),
)
messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]
completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=messages,
    extra_body={
        "enable_thinking": True,
        # "preserve_thinking": True,
    },
    reasoning_effort="xhigh",
    stream=True,
)
# ... process streaming chunks for reasoning_content and answer_content

更多详情可见 API 文档

与编码助手的集成

  • Claude Code:设置 ANTHROPIC_MODEL="qwen3.8-max" 并将 ANTHROPIC_BASE_URL 指向 QwenCloud 兼容端点。
  • Codex:在 ~/.codex/model-catalog.local.json 中添加模型条目,包含 slug: "qwen3.8-max"context_window: 1000000 和适当的推理级别;然后配置 ~/.codex/config.toml 使用 ModelStudio 提供者。
  • Qoder CLI:通过 curl -fsSL https://qoder.com/install | bash 安装并运行 qoder
  • Qwen Code:通过 npm install -g @qwen-code/qwen-code@latest 安装并运行 qwen
  • OpenClaw:按照安装脚本操作,设置 DASHSCOPE_API_KEY,并将 ~/.openclaw/openclaw.json 配置为指向 QwenCloud 端点。

结论

Qwen3.8‑Max 通过将巨大规模(2.4 T 参数)与开放权重可用性、强大的自进化编码能力、广泛的实际工作能力、在硬件设计和商业模拟中的长时优化以及多模态视觉反馈循环相结合,推动了自主 AI 系统的前沿。即将发布的权重以及更小的 Qwen3.8‑27B 变体,为社区提供了强大的基础,以构建能够在编码、专业工作流、研究和创造性任务中以最少人工监督运行的代理。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch