Qwen3.8-Max 發佈說明 / 更新內容

Qwen 已宣佈發佈 Qwen3.8-Max,這是迄今為止 Qwen 系列中最強大的模型。該模型規模達到 2.4 兆參數(其中 95B 為活躍參數),旨在端到端地處理複雜且開放式的目標,特別針對自主編碼、專業研究和長週期任務執行進行了改進。

自主編碼與自我演化

Qwen3.8-Max 從簡單的函數生成轉向了自主專案管理。該模型展現了透過回饋迴圈進行自我演化的能力,以下透過三個主要的測試案例進行證實:

  • 自我演化框架 (Self-Evolving Harness): 在超過 10 天的自主運行中,該模型從零開始構建了 oh-my-cli 專案。它實現了一個包含問題狀態機、調度器和看門狗的迴圈,將社群回饋轉化為可執行的工作。經過 16 天後,該儲存庫累積了 265 個 commits、127 個 PRs 和 151 個 issues。
  • 研究復現與改進: 該模型從零開始復現了「Unified Data Selection for LLM Reasoning」論文(在 125 小時內編寫了 7,600 行程式碼),隨後演化出了一種優於原論文方法的新方法,在 AIME24 基準測試中取得了 +2.7 分的增益。
  • 競賽程式設計: 在 WWW2025 Multimodal Dialogue Intent Recognition Challenge 中,Qwen3.8-Max 與 526 個人類團隊競爭。在 24 小時的限制內自主運作,它達到了 0.853 的準確度,擊敗了 87% 的人類參與者。

專業工作流整合

為了提升通用工作能力,Qwen 在多個框架中擴展了 RL 環境和運算資源,包括 QwenWork、Claude Code 和 Codex。這是透過一個統一的獎勵系統實現的,該系統整合了基於執行的檢查與代理式檢查。

高價值專業表現

Qwen3.8-Max 在數百種專業領域進行了壓力測試,以提供生產級別的結果:

  • 法律: 在不到一小時內完成了數百份文件的企業合規性審查,這是一項通常需要法律助理團隊花上一整週的工作。
  • UI/UX 設計: 一次性產出了高保真、包含 8 個畫面的互動式原型,用於銀行應用程式,且無需人工修改。
  • 工程: 從圖紙中重建了 30 層辦公大樓的地震結構模型,並提供基座剪力 (base shear) 和層間位移 (inter-story drift) 的即時檢查。
  • 醫療: 將 2D 紙本評估轉化為 3D 互動式解剖演示,將交付週期從數週縮短至數分鐘。
  • 金融: 開發了端到端的 ETF 輪動策略,自主修剪冗餘因子以避免過度擬合,並透過 330 個子代理 (sub-agents) 執行大規模並行因子挖掘。

長週期任務執行

Qwen3.8-Max 利用「動作-回饋-迭代」迴圈來處理需要數千輪互動的任務。

自主晶片設計

該模型執行了 GCD/RSA 加密硬體加速器的完整矽設計流程。在沒有參考設計的情況下,它使用「編輯-模擬-合成-佈局」迴圈,將設計從 8,298 個閘 (gates) 減少到 678 個閘。最終的物理佈局實現了晶圓面積 (die area) 減少 81%,並成功在 500 MHz 下達成時序收斂 (timing closure)。

電子商務模擬

在 E-Commerce Bench (一個 365 天的模擬) 中,Qwen3.8-Max 管理了多個商店,處理了供應鏈危機,並使用賽局理論原則與供應商進行談判。它實現了 ¥416,252 的總餘額 (4.16 倍回報),超越了第二名模型 (GLM 5.2) 38%。

多模態智能與混合代理 (Hybrid Agents)

Qwen3.8-Max 將視覺智能整合到整個任務生命週期中,從簡單的圖像理解提升到主動視覺回饋。

  • 視覺回饋迴圈: 該模型可以觀察其自身的介入結果 (例如:頁面佈局或動畫品質),並自主地修正其計畫以糾正偏差。
  • 混合代理能力: 透過將編碼與 GUI 操作結合,該模型可以透過程式碼實現邏輯,同時根據即時系統驗證結果。這已透過 RecreationBench 進行了測試,模型從黑盒觀察中重建了應用程式。
  • 影片影片記憶 (Video Memory): 對於超過 100 小時的影片,該模型構建了一個影片記憶圖譜,用以追蹤角色、事件與關係,並在長時間跨度內進行追蹤。

技術規格與可用性

  • 參數: 2.4 兆 (95B 為活躍參數)。
  • 可用性: 目前可透過 QwenCloud 使用。
  • 開源權重 (Open Weights): 預計於下週在 Hugging Face 和 ModelScope 上發佈。
  • API 功能: 支持 reasoning_effort (xhigh, medium, low) 以平衡深度與成本,以及 preserve_thinking 以確保推理過程的透明度。

Sources