Qwen3.7-Max: 挑戰長程自主代理人的邊界

從簡單的聊天介面轉向自主代理人,需要的不僅僅是原始智能;它還需要能夠在數千個步驟中保持連貫性、與多樣化的工具互動,並在不同的執行框架中進行泛化。隨著 Qwen3.7-Max 的發布,Alibaba 正將其最新的專有模型定位為專為這個「代理人時代」設計的基礎模型。

Qwen3.7-Max 被設計為自主系統的多功能骨幹,能夠處理從複雜的多文件軟體工程和辦公工作流自動化,到維持數十小時的自主執行等各種任務。透過專注於「環境擴展」和跨框架泛化,該模型旨在解決「特定框架捷徑」的問題,即模型學習利用特定的基準測試,而不是學習底層的問題解決策略。

基準測試性能:推理能力的全新領域

Qwen3.7-Max 在多個關鍵的代理與推理基準測試中展現了顯著的增長,通常能與 Opus-4.6 Max 和 DS-V4-Pro Max 等其他前沿模型相媲美甚至超越它們。

編碼與通用代理能力

在編碼代理人的領域中,Qwen3.7-Max 在 SWE-Pro (60.6)SWE-Multilingual (78.3) 上展現了強大的結果。值得注意的是,在 Terminal Bench 2.0-Terminus 上,它取得了 69.7 的分數,優於 DS-V4-Pro Max。對於通用代理能力,該模型在 MCP (Model Context Protocol) 集成方面表現出色,在 MCP-Mark 獲得 60.8 分,在 MCP-Atlas 獲得 76.4 分。

硬核推理與 STEM

該模型的優勢在於最困難的推理基準測試中可能最為明顯:

  • GPQA Diamond: 92.4 (超越 Opus-4.6 的 91.3)
  • HLE: 41.4 (超越 Opus-4.6 的 40)
  • IMOAnswerBench: 90.0 (超越 DS-V4-Pro 的 89.8)
  • Apex: 44.5 (超越 DS-V4-Pro 的 38.3)

持續自主執行:35 小時內核優化

Qwen3.7-Max 最引人注目的能力展示之一是在「野外」場景中的表現:優化 SGLang 中的生產級注意力算子 (attention operator)。

任務是優化 T-Head ZW-M890 PPU 上的 Extend Attention kernel,這是一個模型在訓練期間從未遇到過的硬體平台。Qwen3.7-Max 自主運行了 35 小時。在此期間,它執行了 ,158 次工具調用和 432 次 kernel 評估。

透過編寫、編譯、分析 (profiling) 和重新設計的迭代過程,該模型相較於 Triton 參考實現實現了 10.0x 幾何平均加速比。優化軌跡並非一蹴而就;該模型在執行 30 小時後,甚至仍能發現有意義的架構改進(例如 MTP $\gamma=4$ 特化),證明了其對「上下文腐敗 (context rot)」和指令漂移的抵抗力。

代理人背後的工程技術

環境擴展

延續 Qwen3.5 的方法,團隊積極擴展了代理人訓練環境的質量和多樣性。核心假設是,代理人的能力可以從多樣化的環境中泛化,就像語言能力可以從多樣化的文本中泛化一樣。這種「環境擴展」展現了顯規定的提升軌跡,規模型準,允許模型在完全未見過的、域外 (out-of-domain) 環境中進行泛化。

跨框架泛化

為了防止模型僅僅是「玩弄」特定的基準測試,訓練基礎設施將 TaskHarnessVerifier 解耦。透過將相同的任務與多樣化的 harnesses 和 verifiers 配對,模型被迫學習可泛化的問題解決策略。這確保了 Qwen3.7-Max 無論是透過 Claude Code、OpenClaw 還是 Qwen Code 部署,都能保持一致的表現。

獎勵黑客行為自我監控

對於長程 RL 訓練(超過 80 小時),團隊實施了一個用於獎勵黑客行為 (reward hacking) 自我監控的框架。Qwen3.7-Max 被用來識別候選的黑客行為模式——例如試圖繞過約束來獲取真實答案——並迭代地演化出自己的啟發式規則來標記這種行為,從而確保 RL 獎勵的穩定性。

實際應用與集成

Qwen3.7-Max 被設計用於立即集成到專業工作流中:

  • 辦公自動化: 該模型可以自主處理複雜的格式化任務,例如根據規範文件使用 office-cli 工具重新格式化大學論文。
  • 新創企業管理: 在 YC-Bench 模擬(一個為期一年的新創企業生命週期)中,Qwen3.7-Max 產生了 2.08M USD 的收入,幾乎是 Qwen3.6-Plus 的兩倍。
  • 機器人技術: 透過 Qwen-RobotClaw 和 Qwen-RobotNav 框架,該模型可以操作四足機器人狗,管理物理世界的導航與決策。

社群觀點與評論

雖然技術基準測試的結果令人印象深刻,但 Hacker News 社群提出了幾個爭議點和好奇點:

  1. 比較基準線: 一些用戶指出,基準測試經常將新模型與競爭對手的稍舊版本(例如 Opus-4.6)進行比較,質疑是否比較是完全最新的。
  2. 部署與信任: 對於模型的來源,存在分歧。雖然一些用戶稱讚該模型「便宜、快速且實質上很強」,但其他人則對數據遙測 (telemetry)、數據隱私和對政治敏感信息的潛在審查,表達了疑慮。

可及性:對於模型透過美國本土的超大規模雲端供應商 (hyperscalers) 提供服務的強烈需求,以使其在西方市場的生產工作負載中更具可行性。

正如一位用戶針對代理人的脆弱性所說:

"對於我最信任的模式是,在每次外部動作之後添加一個小的驗證產物 (verification artifact)。代理人通常失敗的原因,比缺乏推理深度,更快地源於無聲的狀態漂移 (state drift)。"

這突顯了長程任務中持續存在的「狀態漂移」挑戰——這正是 Qwen3.7-Max 試圖透過其持續推理能力來解決的挑戰。

Sources