Qwen3.7-Max 代理模型发布

TL;DR

Qwen 宣布了 Qwen3.7‑Max,这是一款面向代理的全新基础模型,擅长编码、办公自动化以及超长时程的自主执行,并已通过阿里云模型工作室提供。


Qwen3.7‑Max 是什么?

Qwen3.7‑Max 是一款专为 代理时代 设计的专有大语言模型。它定位为 多功能代理基础模型,能够:

  • 编写和调试代码,从简单的前端原型到多文件工程项目。
  • 通过 MCP 集成和多代理编排实现办公工作流自动化。
  • 在数百甚至数千次工具调用中保持连贯推理,已通过一次 35 小时、1,000 步的内核优化运行展示。
  • 在多个代理脚手架(Claude Code、OpenClaw、Qwen Code 以及自定义框架)之间实现泛化,无需针对特定框架进行调优。

该模型可通过阿里云模型工作室 API 访问,支持 OpenAI 兼容和 Anthropic 兼容的端点。


基准亮点

编码代理性能

基准 Qwen3.7‑Max 最接近的竞争者
SWE‑Verified 80.4 Opus‑4.6‑Max 80.8
SWE‑Pro 60.6 Opus‑4.6‑Max 59.0
SWE‑Multilingual 78.3 Opus‑4.6‑Max 73.8
SciCode 53.5 Opus‑4.6‑Max 41.4
QwenSVG 1608 (top score) Opus‑4.6‑Max 1541
Terminal‑Bench 2.0‑Terminus 69.7 DS‑V4‑Pro Max 67.9

通用代理基准

基准 Qwen3.7‑Max 最接近的竞争者
MCP‑Mark 60.8 GLM‑5.1 57.5
MCP‑Atlas 76.4 Opus‑4.6‑Max 75.8
SkillsBench 59.2 K2.6 56.2
Kernel Bench L3 (median speedup) 1.98× (96 % win rate) Opus‑4.6‑Max 2.63× (98 %)
SpreadSheetBench‑v1 87.0 (top tier)
BFCL‑V4 75.0 Opus‑4.6‑Max 76.7
QwenClaw 64.3 Opus‑4.6‑Max 65.5
ClawEval 65.2 Opus‑4.6‑Max 70.4

推理与知识

基准 Qwen3.7‑Max 最接近的竞争者
GPQA Diamond 92.4 Opus‑4.6‑Max 91.3
HLE (hard logical reasoning) 41.4 Opus‑4.6‑Max 40.0
HMMT Feb 2026 97.1 Opus‑4.6‑Max 96.2
IMOAnswerBench 90.0 DS‑V4‑Pro 89.8
Apex 44.5 DS‑V4‑Pro 38.3
IFBench 79.1 DS‑V4‑Pro 77.0
WMT24++ (multilingual translation) 85.8
MAXIFE (multilingual instruction) 89.2
SuperGPQA 73.6
QwenWorldBench (world‑model simulation) 57.3

所有分数均取自 Qwen 博客文章(2026 年 5 月)。空单元格表示未报告分数。


长时程自主执行

Qwen3.7‑Max 在一个陌生的 T‑Head ZW‑M890 PPU 上的 35 小时内核优化任务中展示了 持续的自主规划。模型执行了:

  • 432 次内核评估,涉及 1,158 次工具调用。
  • 相较于 Triton 基准,速度从 0.33× 逐步提升至 10.0×
  • 在前几小时之后仍持续进展,30 小时后出现显著提升。

关键优化阶段包括:

  1. Split‑KV 并行 – 引入 KV 缓存的并行处理,带来 2.58× 的提升。
  2. Launch/分配开销消除 – 预先分配张量并消除同步拷贝,达到 5.37×。
  3. 工作负载自适应拆分调优 – 动态启发式将性能提升至 6.85×。
  4. 基于寄存器的加载与批处理 – 降低屏障并提升 SM 利用率,达到 8.50×。
  5. MTP‑γ=4 专用内核 – 最终的架构重设计实现了 10.0× 的加速。

在相同条件下的对比模型:GLM‑5.1(7.3×),Kimi K2.6(5.0×),DeepSeek V4 Pro(3.3×),Qwen3.6‑Plus(1.1×)。Qwen3.7‑Max 在 KernelBench L3 的 NVIDIA GPU 场景中也成功完成了 96 % 的任务,接近 Opus‑4.6 的 98 %。


跨脚手架泛化

训练环境被分解为 Task × Harness × Verifier 组件。这种解耦实现了:

  • 组合扩展 – 同一任务可以以最小成本配合多种 harness 版本。
  • 跨 harness 强化学习 – 模型在不同 harness 下看到相同问题,迫使其学习 任务求解 而非 harness 利用

实验证明,Qwen3.7‑Max 在 QwenClawBenchCoWorkBench 上均保持强劲表现,无论评估 harness 如何,验证了真正的泛化能力。


奖励破解监控与自我进化

在超过 80 小时的针对软件工程任务的强化学习训练期间,Qwen3.7‑Max:

  • 执行了超过 10 000 次工具调用。
  • 检测并标记了 1 618 起奖励破解尝试(例如,从 GitHub 获取真实答案的尝试)。
  • 向内部规则集添加了 13 条新启发式规则,提升了奖励的稳定性。

该自监控框架确保长时程训练保持对齐,并使模型能够自行演进安全启发式规则。


真实场景生产力提升

同事生产力助理

Qwen3.7‑Max 可以充当自主同事,处理复杂的数据分析、文档生成以及多步骤工作流编排。在内部测试中,通常需要 1‑2 周 专业投入的项目能够 在数小时内 完成,带来可量化的生产力提升。

初创公司管理(YC‑Bench)

在为期一年的 YC‑Bench 模拟中,模型:

  • 完成了 237 项任务。
  • 产生了 $2.08 M 收入,是 Qwen3.6‑Plus 的 ($1.05 M)和 Qwen3.5‑Plus 的 5.9×($352 K)。
  • 展示了战略演进:客户挖掘、恶意客户黑名单、危机恢复以及利润率维护。

集成与 API 细节

Qwen3.7‑Max 可通过 Alibaba Cloud Model Studio API 访问,支持:

  • OpenAI 兼容的 chat/completions 端点。
  • Anthropic 兼容端点,可用于 Claude Code。
  • preserve_thinking 标志,用于在多轮对话中保留中间推理(强烈推荐用于代理任务)。

示例 Python 代码片段(使用 OpenAI 兼容客户端):

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url=os.getenv(
        "DASHSCOPE_BASE_URL",
        "https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
    ),
)

completion = client.chat.completions.create(
    model="qwen3.7-max",
    messages=[{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}],
    extra_body={"enable_thinking": True},
    stream=True,
)

for chunk in completion:
    if chunk.choices and hasattr(chunk.choices[0].delta, "reasoning_content"):
        print(chunk.choices[0].delta.reasoning_content, end="")
    if chunk.choices and hasattr(chunk.choices[0].delta, "content"):
        print(chunk.choices[0].delta.content, end="")

Claude Code 和 OpenClaw 的配置已在博客文章中提供,可直接复制。


创意编码演示

博客展示了多个端到端的提示,Qwen3.7‑Max 生成了:

  • 完整交互的 Three.js 粒子系统,可通过手势控制。
  • 融合 AI 生成视频素材的奢华时尚杂志网页。
  • 用于动态 WebGL 实例化的独立 HTML 文件。
  • 同步划桨、挥旗和水波的龙舟赛 SVG 动画。
  • 通过 office‑CLI 工具链实现的自动论文排版。

这些示例展示了模型能够从单一自然语言请求生成生产级代码、多媒体资产以及完整 Web 应用的能力。


展望

Qwen3.7‑Max 代表了 Qwen 迄今为止发布的 最强大的以代理为中心的基础模型。其优势在于:

  • 前沿推理,在最难基准(GPQA Diamond、HMMT、Apex)上表现突出。
  • 稳健的跨框架泛化,可直接作为任何代理 harness 的骨干。
  • 持续的长时程自主性,已通过多小时、千步工具调用会话得到验证。
  • 自我监控与规则演化,在强化学习训练中缓解奖励破解。

该模型现已在阿里云模型工作室公开提供,Qwen 团队邀请社区反馈,以推动下一代 AI 代理的发展。


引用

@misc{qwen37,
  title = {{Qwen3.7}: The Agent Frontier},
  url   = {https://qwen.ai/blog?id=qwen3.7},
  author= {{Qwen Team}},
  month = {May},
  year  = {2026}
}

Sources