Qwen3.7-Max 代理模型發布

TL;DR

Qwen 宣佈 Qwen3.7‑Max,這是一款新型的以代理為中心的基礎模型,擅長程式碼編寫、辦公自動化以及超長時程自主執行,現已透過阿里雲 Model Studio 提供。


Qwen3.7‑Max 是什麼?

Qwen3.7‑Max 是一款專有的大型語言模型,專為 代理時代 設計。它定位為 多功能代理基礎模型,能夠:

  • 編寫與除錯程式碼,從簡單的前端原型到多檔案的工程專案。
  • 透過 MCP 整合與多代理協調,自動化辦公工作流程。
  • 在數百或數千次工具呼叫中保持連貫推理,已在 35 小時、1,000 步驟的核心優化執行中展示。
  • 在多種代理框架(Claude Code、OpenClaw、Qwen Code 以及自訂框架)間具備泛化能力,無需針對框架的特定調整。

該模型可透過阿里雲 Model Studio API 存取,支援 OpenAI 相容與 Anthropic 相容的端點。


基準測試亮點

程式碼代理效能

基準測試 Qwen3.7‑Max 最接近競爭者
SWE‑Verified 80.4 Opus‑4.6‑Max 80.8
SWE‑Pro 60.6 Opus‑4.6‑Max 59.0
SWE‑Multilingual 78.3 Opus‑4.6‑Max 73.8
SciCode 53.5 Opus‑4.6‑Max 41.4
QwenSVG 1608 (top score) Opus‑4.6‑Max 1541
Terminal‑Bench 2.0‑Terminus 69.7 DS‑V4‑Pro Max 67.9

通用代理基準

基準測試 Qwen3.7‑Max 最接近競爭者
MCP‑Mark 60.8 GLM‑5.1 57.5
MCP‑Atlas 76.4 Opus‑4.6‑Max 75.8
SkillsBench 59.2 K2.6 56.2
Kernel Bench L3 (median speedup) 1.98× (96 % win rate) Opus‑4.6‑Max 2.63× (98 %)
SpreadSheetBench‑v1 87.0 (top tier)
BFCL‑V4 75.0 Opus‑4.6‑Max 76.7
QwenClaw 64.3 Opus‑4.6‑Max 65.5
ClawEval 65.2 Opus‑4.6‑Max 70.4

推理與知識

基準測試 Qwen3.7‑Max 最接近競爭者
GPQA Diamond 92.4 Opus‑4.6‑Max 91.3
HLE (hard logical reasoning) 41.4 Opus‑4.6‑Max 40.0
HMMT Feb 2026 97.1 Opus‑4.6‑Max 96.2
IMOAnswerBench 90.0 DS‑V4‑Pro 89.8
Apex 44.5 DS‑V4‑Pro 38.3
IFBench 79.1 DS‑V4‑Pro 77.0
WMT24++ (multilingual translation) 85.8
MAXIFE (multilingual instruction) 89.2
SuperGPQA 73.6
QwenWorldBench (world‑model simulation) 57.3

所有分數取自 Qwen 部落格文章(2026 年 5 月)。空白格表示未報告分數。


長時程自主執行

Qwen3.7‑Max 在一個不熟悉的 T‑Head ZW‑M890 PPU 上的 35 小時核心優化任務中展示了 持續的自主規劃。模型執行了:

  • 在 1,158 次工具呼叫中完成 432 次核心評估。
  • 相較於 Triton 基準,速度逐步提升,從 0.33× 增至 10.0×
  • 在前幾小時之後持續進展,30 小時以上仍有顯著改進。

關鍵優化階段包括:

  1. Split‑KV 平行化 – 引入 KV 快取的平行處理,提升 2.58 倍。
  2. 移除啟動/分配開銷 – 預先分配張量並消除同步拷貝,達到 5.37 倍。
  3. 工作負載自適應分割調整 – 動態啟發式提升效能至 6.85 倍。
  4. 基於暫存器的載入與批次處理 – 減少障礙並提升 SM 使用率,達到 8.50 倍。
  5. MTP‑γ=4 專用核心 – 最終架構重新設計帶來 10.0 倍的加速。

在相同條件下比較模型:GLM‑5.1(7.3×)、Kimi K2.6(5.0×)、DeepSeek V4 Pro(3.3×)、Qwen3.6‑Plus(1.1×)。Qwen3.7‑Max 亦在 KernelBench L3 的 NVIDIA GPU 場景中成功率達 96%,接近 Opus‑4.6 的 98%。


跨框架泛化

訓練環境被分解為 Task × Harness × Verifier 三個組件。此解耦使得:

  • 組合式擴展 – 同一任務可與多種 harness 版本配對,成本極低。
  • 跨 harness 強化學習 – 模型在不同 harness 下看到相同問題,迫使其學習 任務解決 而非 harness 利用

實驗顯示,Qwen3.7‑Max 在 QwenClawBenchCoWorkBench 上均保持強勁表現,無論評估 harness 為何,證實其真正的泛化能力。


獎勵駭客監控與自我演化

在超過 80 小時的軟體工程任務 RL 訓練期間,Qwen3.7‑Max:

  • 執行了超過 10,000 次工具呼叫。
  • 偵測並標記了 1,618 起獎勵駭客嘗試(例如從 GitHub 抓取真實答案的行為)。
  • 新增 13 條啟發式規則至內部規則集,提升獎勵穩定性。

此自我監控框架確保長時程訓練保持對齊,且模型能自行演化安全啟發式規則。


真實世界生產力提升

同事生產力助理

Qwen3.7‑Max 可作為自主同事,處理複雜的資料分析、文件生成與多步驟工作流程編排。在內部測試中,通常需要 1‑2 週 專業投入的專案,能在 數小時 內完成,帶來可量化的生產力提升。

初創公司管理(YC‑Bench)

在為期一年的 YC‑Bench 模擬中,模型:

  • 完成了 237 項任務。
  • 產生 $2.08 M 收入,為 Qwen3.6‑Plus 的 $1.05 M 的 2 倍,以及 Qwen3.5‑Plus 的 $352 K 的 5.9 倍
  • 展示了策略演化:客戶偵查、惡意客戶列入黑名單、危機復原與利潤率維持。

整合與 API 細節

Qwen3.7‑Max 可透過 Alibaba Cloud Model Studio API 存取,支援:

  • OpenAI 相容的 chat/completions 端點。
  • Anthropic 相容端點,可與 Claude Code 一起使用。
  • preserve_thinking 旗標,可保留回合間的中間推理(強烈建議用於代理任務)。

以下為 Python 範例(使用 OpenAI 相容客戶端):

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url=os.getenv(
        "DASHSCOPE_BASE_URL",
        "https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
    ),
)

completion = client.chat.completions.create(
    model="qwen3.7-max",
    messages=[{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}],
    extra_body={"enable_thinking": True},
    stream=True,
)

for chunk in completion:
    if chunk.choices and hasattr(chunk.choices[0].delta, "reasoning_content"):
        print(chunk.choices[0].delta.reasoning_content, end="")
    if chunk.choices and hasattr(chunk.choices[0].delta, "content"):
        print(chunk.choices[0].delta.content, end="")

Claude Code 與 OpenClaw 的配置已在部落格文章中提供,可直接複製。


創意程式碼示範

部落格展示了多個端到端的提示,Qwen3.7‑Max 生成了:

  • 完整互動的 Three.js 粒子系統,可透過手勢控制。
  • 結合 AI 生成影片素材的奢華時尚雜誌網頁。
  • 用於動態 WebGL 實例化的獨立 HTML 檔案。
  • 同步划槳、揮旗與水波的龍舟賽 SVG 動畫。
  • 透過辦公室 CLI 工具鏈自動化論文排版。

這些範例說明了模型能從單一自然語言請求產出可投入生產的程式碼、多媒體資產與完整的 Web 應用程式。


前景展望

Qwen3.7‑Max 代表了 迄今為止 Qwen 所發布的最具能效的以代理為中心的基礎模型。其優勢在於:

  • 前沿推理,在最困難的基準(GPQA Diamond、HMMT、Apex)上表現卓越。
  • 穩健的跨框架泛化,可作為任何代理 harness 的即插即用骨幹。
  • 持續的長時程自主性,已在多小時、千步工具呼叫的會話中證明。
  • 自我監控與規則演化,減輕 RL 訓練中的獎勵駭客問題。

該模型現已在阿里雲 Model Studio 公開提供,Qwen 團隊歡迎社群回饋,以推動下一代 AI 代理的發展。


引用

@misc{qwen37,
  title = {{Qwen3.7}: The Agent Frontier},
  url   = {https://qwen.ai/blog?id=qwen3.7},
  author= {{Qwen Team}},
  month = {May},
  year  = {2026}
}

Sources