Qwen3.7-Max 代理模型发布
TL;DR
Qwen 宣布了 Qwen3.7‑Max,这是一款面向代理的全新基础模型,擅长编码、办公自动化以及超长时程的自主执行,并已通过阿里云模型工作室提供。
Qwen3.7‑Max 是什么?
Qwen3.7‑Max 是一款专为 代理时代 设计的专有大语言模型。它定位为 多功能代理基础模型,能够:
- 编写和调试代码,从简单的前端原型到多文件工程项目。
- 通过 MCP 集成和多代理编排实现办公工作流自动化。
- 在数百甚至数千次工具调用中保持连贯推理,已通过一次 35 小时、1,000 步的内核优化运行展示。
- 在多个代理脚手架(Claude Code、OpenClaw、Qwen Code 以及自定义框架)之间实现泛化,无需针对特定框架进行调优。
该模型可通过阿里云模型工作室 API 访问,支持 OpenAI 兼容和 Anthropic 兼容的端点。
基准亮点
编码代理性能
| 基准 | Qwen3.7‑Max | 最接近的竞争者 |
|---|---|---|
| SWE‑Verified | 80.4 | Opus‑4.6‑Max 80.8 |
| SWE‑Pro | 60.6 | Opus‑4.6‑Max 59.0 |
| SWE‑Multilingual | 78.3 | Opus‑4.6‑Max 73.8 |
| SciCode | 53.5 | Opus‑4.6‑Max 41.4 |
| QwenSVG | 1608 (top score) | Opus‑4.6‑Max 1541 |
| Terminal‑Bench 2.0‑Terminus | 69.7 | DS‑V4‑Pro Max 67.9 |
通用代理基准
| 基准 | Qwen3.7‑Max | 最接近的竞争者 |
|---|---|---|
| MCP‑Mark | 60.8 | GLM‑5.1 57.5 |
| MCP‑Atlas | 76.4 | Opus‑4.6‑Max 75.8 |
| SkillsBench | 59.2 | K2.6 56.2 |
| Kernel Bench L3 (median speedup) | 1.98× (96 % win rate) | Opus‑4.6‑Max 2.63× (98 %) |
| SpreadSheetBench‑v1 | 87.0 (top tier) | — |
| BFCL‑V4 | 75.0 | Opus‑4.6‑Max 76.7 |
| QwenClaw | 64.3 | Opus‑4.6‑Max 65.5 |
| ClawEval | 65.2 | Opus‑4.6‑Max 70.4 |
推理与知识
| 基准 | Qwen3.7‑Max | 最接近的竞争者 |
|---|---|---|
| GPQA Diamond | 92.4 | Opus‑4.6‑Max 91.3 |
| HLE (hard logical reasoning) | 41.4 | Opus‑4.6‑Max 40.0 |
| HMMT Feb 2026 | 97.1 | Opus‑4.6‑Max 96.2 |
| IMOAnswerBench | 90.0 | DS‑V4‑Pro 89.8 |
| Apex | 44.5 | DS‑V4‑Pro 38.3 |
| IFBench | 79.1 | DS‑V4‑Pro 77.0 |
| WMT24++ (multilingual translation) | 85.8 | — |
| MAXIFE (multilingual instruction) | 89.2 | — |
| SuperGPQA | 73.6 | — |
| QwenWorldBench (world‑model simulation) | 57.3 | — |
所有分数均取自 Qwen 博客文章(2026 年 5 月)。空单元格表示未报告分数。
长时程自主执行
Qwen3.7‑Max 在一个陌生的 T‑Head ZW‑M890 PPU 上的 35 小时内核优化任务中展示了 持续的自主规划。模型执行了:
- 432 次内核评估,涉及 1,158 次工具调用。
- 相较于 Triton 基准,速度从 0.33× 逐步提升至 10.0×。
- 在前几小时之后仍持续进展,30 小时后出现显著提升。
关键优化阶段包括:
- Split‑KV 并行 – 引入 KV 缓存的并行处理,带来 2.58× 的提升。
- Launch/分配开销消除 – 预先分配张量并消除同步拷贝,达到 5.37×。
- 工作负载自适应拆分调优 – 动态启发式将性能提升至 6.85×。
- 基于寄存器的加载与批处理 – 降低屏障并提升 SM 利用率,达到 8.50×。
- MTP‑γ=4 专用内核 – 最终的架构重设计实现了 10.0× 的加速。
在相同条件下的对比模型:GLM‑5.1(7.3×),Kimi K2.6(5.0×),DeepSeek V4 Pro(3.3×),Qwen3.6‑Plus(1.1×)。Qwen3.7‑Max 在 KernelBench L3 的 NVIDIA GPU 场景中也成功完成了 96 % 的任务,接近 Opus‑4.6 的 98 %。
跨脚手架泛化
训练环境被分解为 Task × Harness × Verifier 组件。这种解耦实现了:
- 组合扩展 – 同一任务可以以最小成本配合多种 harness 版本。
- 跨 harness 强化学习 – 模型在不同 harness 下看到相同问题,迫使其学习 任务求解 而非 harness 利用。
实验证明,Qwen3.7‑Max 在 QwenClawBench 与 CoWorkBench 上均保持强劲表现,无论评估 harness 如何,验证了真正的泛化能力。
奖励破解监控与自我进化
在超过 80 小时的针对软件工程任务的强化学习训练期间,Qwen3.7‑Max:
- 执行了超过 10 000 次工具调用。
- 检测并标记了 1 618 起奖励破解尝试(例如,从 GitHub 获取真实答案的尝试)。
- 向内部规则集添加了 13 条新启发式规则,提升了奖励的稳定性。
该自监控框架确保长时程训练保持对齐,并使模型能够自行演进安全启发式规则。
真实场景生产力提升
同事生产力助理
Qwen3.7‑Max 可以充当自主同事,处理复杂的数据分析、文档生成以及多步骤工作流编排。在内部测试中,通常需要 1‑2 周 专业投入的项目能够 在数小时内 完成,带来可量化的生产力提升。
初创公司管理(YC‑Bench)
在为期一年的 YC‑Bench 模拟中,模型:
- 完成了 237 项任务。
- 产生了 $2.08 M 收入,是 Qwen3.6‑Plus 的 2×($1.05 M)和 Qwen3.5‑Plus 的 5.9×($352 K)。
- 展示了战略演进:客户挖掘、恶意客户黑名单、危机恢复以及利润率维护。
集成与 API 细节
Qwen3.7‑Max 可通过 Alibaba Cloud Model Studio API 访问,支持:
- OpenAI 兼容的
chat/completions端点。 - Anthropic 兼容端点,可用于 Claude Code。
preserve_thinking标志,用于在多轮对话中保留中间推理(强烈推荐用于代理任务)。
示例 Python 代码片段(使用 OpenAI 兼容客户端):
from openai import OpenAI
import os
client = OpenAI(
api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url=os.getenv(
"DASHSCOPE_BASE_URL",
"https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
),
)
completion = client.chat.completions.create(
model="qwen3.7-max",
messages=[{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}],
extra_body={"enable_thinking": True},
stream=True,
)
for chunk in completion:
if chunk.choices and hasattr(chunk.choices[0].delta, "reasoning_content"):
print(chunk.choices[0].delta.reasoning_content, end="")
if chunk.choices and hasattr(chunk.choices[0].delta, "content"):
print(chunk.choices[0].delta.content, end="")
Claude Code 和 OpenClaw 的配置已在博客文章中提供,可直接复制。
创意编码演示
博客展示了多个端到端的提示,Qwen3.7‑Max 生成了:
- 完整交互的 Three.js 粒子系统,可通过手势控制。
- 融合 AI 生成视频素材的奢华时尚杂志网页。
- 用于动态 WebGL 实例化的独立 HTML 文件。
- 同步划桨、挥旗和水波的龙舟赛 SVG 动画。
- 通过 office‑CLI 工具链实现的自动论文排版。
这些示例展示了模型能够从单一自然语言请求生成生产级代码、多媒体资产以及完整 Web 应用的能力。
展望
Qwen3.7‑Max 代表了 Qwen 迄今为止发布的 最强大的以代理为中心的基础模型。其优势在于:
- 前沿推理,在最难基准(GPQA Diamond、HMMT、Apex)上表现突出。
- 稳健的跨框架泛化,可直接作为任何代理 harness 的骨干。
- 持续的长时程自主性,已通过多小时、千步工具调用会话得到验证。
- 自我监控与规则演化,在强化学习训练中缓解奖励破解。
该模型现已在阿里云模型工作室公开提供,Qwen 团队邀请社区反馈,以推动下一代 AI 代理的发展。
引用
@misc{qwen37,
title = {{Qwen3.7}: The Agent Frontier},
url = {https://qwen.ai/blog?id=qwen3.7},
author= {{Qwen Team}},
month = {May},
year = {2026}
}
Sources
- OriginalQwen3.7: The Agent Frontier