Qwen3.8-Max 發布:2.4T 參數模型,具備開放權重與自主編碼提升

總覽

Qwen3.8-Max 是目前 Qwen 家族中最強大的模型,擁有 2.4 兆參數,其中 950 億為活躍參數,也是首個權重將開放原始碼的 Qwen‑Max‑class 模型(預計下週發布)。該模型在編碼、真實工作、研究及長時程任務方面實現全面提升,使得在極少人工介入的情況下,能夠完成複雜目標的端到端執行。

編碼能力

Qwen3.8-Max 能夠自主驅動從零開始的多日軟體專案,直至完成,全程無需人工干預。在一次 10 天以上的運行中,它構建了 oh-my-cli 自我演進框架,截至 2026 年 7 月 30 日累計提交 265 次、拉取請求 127 次以及議題 151 個。該框架結合了議題狀態機、調度器、監控器和看門狗;每次更新後會觸發建置、單元測試、端到端測試與桌面生命週期驗證,將異常狀態路由回相關議題/拉取請求進行修復。它也會透過將社區回饋與自測結果轉換為可執行工作來自我演進,持續精煉 /goal/resume、動態工作流程、會話重播及桌面等功能。

在另一項實驗中,Qwen3.8-Max 從零開始重現論文《"Unified Data Selection for LLM Reasoning"》,然後對其進行改進。在約 5 天內,它編寫了約 7,600 行程式碼,執行了 33 次 GPU 訓練輪次,重現了論文的六項主要發現,並在 AIME24 上以隨機資料選擇為基準提升了 +7.7%。透過自我演進的研究迴路,它在四輪中測試了 18 個想法,最終發明了一種計算艱難決策點(「nhighgate」)的方法,在 AIME24 上較論文方法提升了 +2.7 分。

Qwen3.8-Max 也參加了阿里雲天平台上的 WWW2025 多模態對話意圖識別挑戰賽,該賽事有 526 支人類隊伍參賽。在 24 小時限制下自主運行,它構建了一個解決方案:對文字進行 BERT、MacBERT 與 RoBERTa 的微調與集成;對截圖使用以 Chinese‑CLIP 為支援的 Qwen2.5‑VL‑7B 進行微調;再透過交叉驗證校準的加權投票系統融合它們。其準確率從 0.60 提升至 0.853(共 45 次提交),擊敗了 526 隊中的 458 隊(佔全體 87%)。

這三個案例表明,Qwen3.8-Max 能在數天內專注於開放式目標,自行生成假設並將其轉化為可工作的成果,全程無需人工介入。

工作能力

除了編碼,Qwen3.8-Max 亦經過訓練以處理構成真實工作的異質且工具密集型工作流程。擴展真實世界強化學習(RL)系統涉及三個相互耦合的挑戰:(1)持續沿任務、工作空間和框架軸擴展脫耦的真實環境,使增長呈組合複合式;(2)構建一個統一的獎勵系統,融合基於執行的檢查、針對文字與視覺輸出的規則條件 adjudication,以及在可自動擴展規則下的代理式檢查;(3)採用線上資料平衡器,使每個批次在任務、難度、工作空間和框架上保持高度平衡,抑制批次間梯度變異,從而實現穩定的 RL 擴展。

因此,Qwen3.8-Max 在數十項內部及公開的工作基準上隨著 RL 訓練的規模擴大而展現穩定且一致的提升,並在 QwenWork、Claude Code、Codex、OpenClaw 與 Hermes 等框架上達到可比的效能。

對數百個高價值職業進行廣度測試得到以下代表性結果:

  • 企業合規顧問:在不到一小時內從數百份文件中檢測出 1,284 條相關條款,而法律助理團隊則需一週。
  • UI/UX 設計師:一次完成 NOVA 銀行應用的 8 頁高保真互動原型,零次修訂,而傳統流程則需 3–5 輪。
  • 餐廳品牌創辦人:一次生成含熱量與食材溯源的 26 品目選單,食物成本比維持在 33.8%,而傳統方式則需數週的迭代測試。
  • 結構工程師:在瀏覽器中重建 30 層辦公塔的抗震模型,自然週期、基底剪力及層間漂移比可懸停查看,而專業軟體則需超過一週。
  • 康復治療師:將 2D 紙本評估轉為具可旋轉視角與解剖覆蓋的 3D 互動示範,取代醫療動畫工作室原本需 2–4 週、成千上萬美元的流程。
  • 體育數據分析師:將每位選手約 8,400 次進攻/防守回合解析為戰術輪廓與教練報告,僅需數十分鐘,而傳統團隊則需數天。

Qwen3.8-Max 也在定量研究方面展現深度:從六個短因子家族描述中衍生出約 330 個子代理,執行約 6,000 次回測並持續調整工作流程。經篩選的因子達成超額夏普比率 0.64–1.48,資訊係數在 0.010–0.014 之間均為正值。模型動態修剪過度適配的因子,加入多種子聯合驗證以消除路徑依賴,並在集成效果不佳時切換至更穩健的合成策略。

這些例子說明 Qwen3.8‑Max 能在多樣化的專業工作流程中交付生產級品質的結果,常能將原本需數週人力的工作壓縮至一次自主會話。

長時程任務表現

Qwen3.8‑Max 在需要數千次互動回合的任務上展現出強大的系統層級自主規劃與閉環自適應學習。

在自主晶片設計中,模型獨立完成了 GCD/RSA 加密硬體加速器的完整晶片流程。從一個 stub RTL 工作區開始,它在 13 個里程碑上執行了 500 次互動與 71 次評估,將門檻數從 8,298 減少至 678(晶片面積減少 81%),並在 500 MHz 下實現時序閉環,餘量為 +0.66 ns。關鍵里程碑包括:用迭代位移減法架構取代 16 位硬體模數除法器(節省 6,288 個門檻)、消除冗餘、修減位寬、修剪控制有限狀態機、融合模組,以及應用門檻級優化,如共用 NOR‑gate 樹與絕對差減法分割。透過 OpenROAD 進行的實體實作證明,前端優化直接轉化為緊湊且可布線的晶片。

在 365 天的電子商務基準模擬中,Qwen3.8‑Max 起始資本為 ¥100,000,面對包含 152 家詐騙商家的供應商矩陣,管理庫存、定價、退貨及現金流,並在真實季節性衝擊下進行。它在價格談判中實現持續學習,談判效率隨時間提升並將收益推廣至類似產品。模型早期大舉投資以建立市場地位,最終在年底促銷期間實現淨利潤超過 ¥100,000——幾乎是第二名 GLM 5.2 的 2.4 倍。最終總餘額達到 ¥416,252(即 4.16 倍報酬),超過 GLM 5.2 38%,相較於其前身 Qwen3.7‑Max 提升了 152%。這些結果凸顯 Qwen3.8‑Max 在超過 2,000 次互動回合的交易回饋中進行長時程連貫決策與自適應學習的能力。

多模態代理能力

Qwen3.8‑Max 將視覺視為貫穿規劃、執行、驗證與迭代的原生回饋迴路。它能理解並生成跨圖像、文件及超過 100 小時的影片內容,構建連結人物、事件、時間戳與場景的視訊記憶圖。在執行期間,它會持續檢查中間結果——頁面佈局、物體方向、空間關係、動畫品質與互動結果——並在偵測到不匹配時自主修訂計畫。

該模型也支援混合代理工作流程,將程式碼生成與 GUI 操作配對。在 RecreationBench 基準(橫跨 Ubuntu、macOS、Windows、Android 與網頁)中,Qwen3.8‑Max 透過與黑箱二進位檔案互動,在編碼與 GUI 回饋循環中從零重建應用程式。為了簡化整合,實驗室發布了 Qwen‑MM‑Plugins,一種提供圖片/影片處理、多模態記憶、動態解析支援、視覺工具使用,以及針對影片編輯、Blender 與 CAD 的專用功能的框架擴充套件。

部署與存取

Qwen3.8‑Max 可透過 QwenCloud 使用。API 用法包含一個 reasoning_effort 參數,具有三個等級:

  • xhigh (預設):適用於需要深入分析的複雜任務
  • medium:在準確度與速度間取得平衡
  • low:優先考慮速度與成本 preserve_thinking 預設為啟用,以獲得最佳的即用體驗。

原始碼中提供了透過 OpenAI‑相容端點呼叫模型的範例程式碼,示範如何設定 model="qwen3.8-max"、啟用思考以及串流回應。

該模型與流行的代理框架及編碼助手整合:

  • Claude Code:設定 ANTHROPIC_MODEL="qwen3.8-max" 並指向 QwenCloud 基礎 URL。
  • Codex:在 ~/.codex/model-catalog.local.json 新增模型條目,設定 context_window 為 1,000,000 並支援低/中/xhigh 推理等級。
  • Qoder CLI:透過提供的腳本安裝並執行 qoder
  • Qwen Code:安裝 @qwen-code/qwen-code@latest 並執行 qwen
  • OpenClaw:設定 ~/.openclaw/openclaw.json 以使用 QwenCloud 相容模式端點。

模型權重將於公告隔週在 Hugging Face 與 ModelScope 上開放原始碼。

社區反應(來自 Hacker News 評論)

評論者指出了幾個值得關注的點:

  • 有使用者指出即將發布的 Qwen3.8‑27B 密集模型可能對本地推論具有重要意義,並表示 "Qwen3.8‑27B 是此處的真正新聞"。 ([@boredatoms])
  • 一位使用者指出預覽版(Qwen3.8‑Max‑Preview)自 7 月 19 日起已在阿里巴巴的 Token Plan、Qoder 與 QoderWork 上可用,質疑 8 月 3 日的公告實際新增了什麼。 ([@simonw])
  • 成本討論:reasoning_effort 選項被提及為控制費用的方式,有一位評論者希望它會「顯著更便宜」於替代方案。 ([@ddxv])
  • 對模型自我演進行為是否涉及從其他模型蒸餾的猜測,例如 "這是否意味著他們蒸餾了 Claude?"。 ([@choppaface])
  • 對首個開放權重的 Qwen‑Max‑class 模型的熱情,形容為 "Nice!" ([@wxw]) 以及 "開源社區可能需要集體 GoFundMe 才能購買足夠的 VRAM 來托管這個巨無霸"。 ([@khanhnguyen8386])
  • 關於在本地運行模型的實際考量,包括硬體需求(一位使用者指出 2080 Ti 在處理 27B 密集模型時會吃力)以及需要大量 VRAM 來托管 2.4 T‑參數版本。 ([@aliljet], [@khanhnguyen8386])
  • 對將模型擴展至影像/影片生成的興趣,並詢問是否會發布任何影像或影片生成功能。 ([@SXX])
  • 部分使用者對新穎度表示懷疑,指出基準提升相比先前模型僅屬遞增。 ([@HarHarVeryFunny])
  • 少數評論者對資料保留政策提出疑慮,要求澄清 QwenCloud 是否會將 API 輸入用於訓練。 ([@Aldipower])

這些社區洞見反映了對開放權重發布的興奮、對成本與可及性的好奇,以及對模型實用性與限制的持續討論。

基準亮點

該貼文包含一份詳細的基準表,比較 Qwen3.8‑Max 與 Opus4.8、Fable5、GPT5.6 Sol (max) 及 Qwen3.7‑Max。經選出的結果:

  • 編碼代理:Terminal Bench 2.1 86.6 %(對比 Qwen3.7‑Max 的 74.5 %),SWE‑bench Pro 67.7 %(對比 60.6 %),DeepSWE 1.1 56.6 %(對比 21.6 %),PaperBench 93.0 %(對比 64.8 %),QwenSWEBench 80.7 %(對比 63.4 %)。
  • 一般代理:CoWorkBench 74.8 %(對比 64.6 %),WorkSpaceBench 67.7 %(對比 61.4 %),JobBench 53.4 %(對比 31.3 %),SkillsBench 70.2 %(對比 61.2 %)。
  • 一般能力:GPQA Diamond 92.6 %(對比 92.4 %),IFBench 82.8 %(對比 79.1 %),HealthBench 60.2 %(對比 54.5 %),PLawBench 73.2 %(對比 58.9 %)。
  • 長上下文:MRCR v2 256K 92.9 %(對比 86.7 %),LongBench v2 66.3 %(對比 65.3 %)。
  • 多模態推理:MMMU‑Pro 82.3 %(對比 79.0 %),MathVision 95.2 / 97.7(對比 90.3 / --),BabyVision 82.0 / 91.3(對比 64.7 / 70.4),HiPhO 90.0 %(對比 84.1 %)。
  • 視覺代理 & 編碼:OSWorld‑Verified 86.1 %(對比 73.3 %),AndroidWorld 85.3 %(對比 81.0 %),Parametric CAD Bench 91.5 %(對比 73.8 %)。
  • 文件 & 辦公智慧:CharXiv (RQ) 88.4 / 93.5(對比 85.8 / 85.9),OmniDocBench 1.5 92.1 %(對比 91.4 %)。
  • 真實世界 & 空間理解:RealWorldQA 88.0 %(對比 86.9 %),ERQA 77.8 %(對比 69.8 %)。
  • 影片智慧 & 代理:VideoMME (w/ Sub.) 90.4 %(對比 88.0 %),VideoMMMU 88.7 %(對比 85.4 %)。

這些數據說明 Qwen3.8‑Max 在編碼、一般代理、多模態推理及長上下文任務上相較於其前身及競爭模型的進步。

展望

Qwen3.8‑Max 透過結合巨大規模與開放權重、在編碼與研究中展現強大的自我演進迴路,以及在多樣化專業工作流程中的顯著熟練度,為自主長時程 AI 代理設定了新基準。即將發布的 2.4 T‑參數權重以及較小的 27B 密集變體將促進更廣泛的實驗,而所提供的 API 與框架整合旨在降低構建代理系統的門檻。持續的社區回饋將對評估真實世界可用性、成本效益以及潜在擴展(如影像或影片生成功能)至關重要。

Sources