Qwen3.7-Max: 突破长程自主智能体的边界
从简单的聊天界面向自主智能体的转变不仅需要原始智能,还需要在数千个步骤中保持连贯性、与多种工具交互以及在不同执行框架中进行泛化的能力。随着 Qwen3.7-Max 的发布,阿里巴巴正将其最新的专有模型定位为专门为这一“智能体时代”设计的基石。
Qwen3.7-Max 被设计为自主系统的多功能骨干,能够处理从复杂的多文件软件工程和办公工作流自动化到维持数十小时的自主执行等各种任务。通过专注于“环境扩展”和跨框架泛化,该模型旨在解决“特定框架捷径”问题,即模型学会利用特定的基准测试而非学习底层的解题策略。
基准测试性能:推理的新前沿
Qwen3.7-Max 在多个关键的智能体和推理基准测试中表现出显著提升,其表现往往能与 Opus-4.6 Max 和 DS-V4-Pro Max 等其他前沿模型相媲美甚至超越它们。
编程与通用智能体能力
在编程智能体领域,Qwen3.7-Max 在 SWE-Pro (60.6) 和 SWE-Multilingual (78.3) 上表现强劲。值得注意的是,在 Terminal Bench 2.0-Terminus 上,它取得了 69.7 的分数,优于 DS-V4-Pro Max。对于通用智能体能力,该模型在 MCP (Model Context Protocol) 集成方面表现出色,在 MCP-Mark 上得分 60.8,在 MCP-Atlas 上得分 76.4。
困难推理与 STEM
该模型的优势在最难的推理基准测试中可能最为明显:
- GPQA Diamond: 92.4 (超过 Opus-4.6 的 91.3)
- HLE: 41.4 (超过 Opus-4.6 的 40)
- IMOAnswerBench: 90.0 (超过 DS-V4-Pro's 89.8)
- Apex: 44.5 (超过 DS-V4-Pro's 38.3)
持续自主执行:35 小时内核优化
Qwen3.7-Max 最引人注目的能力展示之一是在“野外”场景下的表现:优化 SGLang 中的生产级注意力算子。
任务是优化 T-Head ZW-M890 PPU 上的 Extend Attention 内核——这是一个模型在训练期间从未遇到过的硬件平台。Qwen3.7-Max 自主运行了 35 小时。在此期间,它执行了 1,158 次工具调用和 432 次内核评估。
通过编写、编译、分析性能、重新设计的迭代过程,该模型相比 Triton 参考实现实现了 10.0x 几何平均加速比。优化轨迹并非一蹴而就;即使在执行 30 小时后,模型仍能发现有意义的架构改进(例如 MTP $\gamma=4$ 特化化),证明了其对抗“上下文腐化”和指令漂移的韧性。
智能体背后的工程实现
环境扩展
遵循 Qwen3.5 的方法,团队积极扩展了智能体训练环境的质量和多样性。核心假设是,智能体能力可以像语言能力从多样化文本中泛化一样,从多样化环境中泛化。这种“环境扩展”显示出了可预测的的提升轨迹,使模型能够泛化到完全未见的、领域外的环境。
跨框架泛化
为了防止模型仅仅是“刷分”特定基准测试,训练基础设施将 Task、Harness 和 Verifier 解耦。通过将相同的任务与多样化的框架和验证器配对,迫使模型学习可泛化的解题策略。这确保了 Qwen3.7-Max 无论通过 Claude Code、OpenClaw 还是 Qwen Code 部署,都能表现一致。
奖励作弊自我监控
对于长程 RL 训练(超过 80 小时),团队实现了一个用于奖励作弊自我监控的框架。Qwen3.7-Max 被用于识别候选的作弊模式——例如试图绕过约束以获取真实答案——并迭代地演化出自己的启发式规则来标记此类行为,从而确保 RL 奖励的稳定性。
实际应用与集成
Qwen3.7-Max 旨在立即集成到专业工作流中:
- 办公自动化: 模型可以自主处理复杂的格式化任务,例如使用 office-cli 工具根据规范文档重新格式化大学论文。
- 初创公司管理: 在 YC-Bench 模拟(为期一年的初创公司生命周期)中,Qwen3.7-Max 产生了 2.08M USD 的收入,几乎是 Qwen3.6-Plus 的两倍。
- 机器人: 通过 Qwen-RobotClaw 和 Qwen-RobotNav 框架,模型可以操作四足机器人狗,管理物理世界的导航和决策。
社区观点与批评
虽然技术基准测试的表现令人印象深刻,但 Hacker News 社区提出了几个争议点和好奇点:
- 比较基准: 一些用户指出,基准测试经常将新模型与竞争对手稍旧的版本进行比较(例如 Opus-4.6),质疑比较是否完全是最新的。
- 部署与信任: 对于模型的来源存在分歧。一些用户称赞该模型“便宜、快速且确实很棒”,而另一些用户则对遥测、数据隐私以及对政治敏感信息的潜在审查表示担忧。
- 可访问性: 存在一种强烈的需求,希望该模型能通过美国本土的超大规模云服务商提供,以便于其在西方市场的生产环境中使用。
正如一位用户针对智能体的脆弱性所指出的:
"我最信任的模式是在每次外部动作之后添加一个小的验证环节。智能体通常由于隐性状态漂移,比由于缺乏推理深度而失败得更快。"
这突显了长程任务中持续存在的“状态漂移”挑战——这也是 Qwen3.7-Max 试图通过其持续推理能力显式解决的挑战。