Qwen3.8-Max 發布:2.4T‑參數模型,下週開放權重,以及廣泛的自主能力
Qwen3.8‑Max 總覽
Qwen3.8‑Max 是目前 Qwen 系列中最強大的模型,規模達到 2.4 兆參數(95 B 活躍),並在編碼、工作、研究及長時程任務方面實現全面提升。此次發布標誌著首次將 Qwen‑Max‑級模型的權重開源,開放權重將於下週釋出。
編碼能力
自主自我演進工具鏈
Qwen3.8‑Max 被指派從零開始構建 oh‑my‑cli 專案,並在超過 10+ 天 的長時程自主編碼運行中,構建了一個能持續納入使用者回饋、社區實踐與自測結果的自我演進工具鏈。截至 2026 年 7 月 30 日,在約 16 天 的完全自主運作後,該儲存庫累積了 265 次提交、127 個 PR 與 151 個 issue【...】。
該工具鏈的關鍵元素包括 issue 狀態機、分派器、監視器與看門狗,構成執行迴路;自我測試會將異常狀態路由回相關的 issue/PR;以及多來源演進,將社區經驗與回饋轉化為可執行的工作。
重現並改進一篇研究論文
給定論文 “Unified Data Selection for LLM Reasoning” (arXiv:2605.22389) 以及一組 GPU,Qwen3.8‑Max 花費約 五天(~125 小時)編寫約 7,600 行程式碼,進行 33 次 GPU 訓練,並重現該論文的六項主要發現。接著,它在接下來的約 88 小時 內進入自我改進的研究迴圈,跨四輪測試 18 個改進想法。最終方法——計算艱難決策點(“nhighgate”)——在 AIME24 基準上相較於論文基線獲得 +2.7 分 的提升【...】。
在 24 小時競賽中擊敗人類團隊
在 WWW2025 多模態對話意圖識別挑戰賽(由阿里巴巴雲的 Tianchi 平台主辦)中,面對 526 支人類團隊,Qwen3.8‑Max 在嚴格的 24 小時 限制下自主運行。它構建了一個方案,對文本進行 BERT、MacBERT 與 RoBERTa 的微調與集成,並以 Chinese‑CLIP 為後盾的 Qwen2.5‑VL‑7B 視覺語言模型處理截圖,透過加權投票系統融合。在 45 次提交 中,其準確率從 0.60 提升至 0.853,擊敗 526 支團隊中的 458 支(領域的 87 %)【...】。
這三個案例說明 Qwen3.8‑Max 能在數天內專注於開放式目標,自行產生想法,並將其轉化為可工作的成果,無需人類干預。
真實世界工作能力
擴展真實世界 RL 系統
Qwen3.8‑Max 的工作能力透過同時擴展 RL 環境與計算資源得到提升。我們解決了三個耦合挑戰:
- 沿著獨立軸持續擴展解耦的真實環境——任務(單任務 → 多任務 → 多日)、工作空間(單檔案 → 階層 → 複雜異質資料夾)以及工具鏈(類別、版本、技能),使環境增長呈組合式複合。
- 一個普遍的獎勵系統,內化異質驗證(基於執行的檢查、依據文字/視覺輸出的規則條件 adjudication、具代理性的檢查),在自動可擴展的規則下運作。
- 一個線上資料平衡器,使每個批次在任務、難度、工作空間與工具鏈上的分布保持高度平衡,抑制跨批次梯度變異,維持穩定的 RL 計算擴展。
這些共同提供廣度、可靠獎勵與穩定性,產生可測量的水平提升在真實世界工作能力上。
橫跨數百種職業的廣度
壓力測試顯示 Qwen3.8‑Max 在許多高價值職業的真實工作流程中能交付生產品質結果:
- 企業合規顧問:在不到一小時內從數百份文件中檢測出 1,284 條相關條款,而法律助理團隊通常需要一週。
- UI/UX 設計師:在零次人工修訂的情況下,一次性完成數位銀行應用程式 NOVA(8 個畫面)的高保真互動原型,而傳統流程通常需 3–5 輪。
- 餐廳品牌創始人:閱讀超過一百份食材供應簡報,一次性完成完整的 26 道菜單,每道菜標註平均熱量與食材來源,使食物成本比維持在 33.8 %。
- 結構工程師:在瀏覽器中重建 30 層辦公塔樓的抗震結構模型,自然週期、基底剪力與層間漂移比可懸停查看,這項任務在專業軟體中通常需超過一週。
- 復健治療師:將 2D 紙本評估表轉為可自由旋轉視角、層層解剖覆蓋的 3D 互動示範,此任務先前需外包給醫學動畫工作室,週期 2–4 週且成本數千美元。
- 運動數據分析師:將每位**:** 解析每位球員約 8,400 次進攻/防守回合,在數十分鐘內生成可直接使用的球員戰術輪廓與教練報告,而傳統分析團隊通常需數個工作日。
在單次會話中構建可獲利的端到端量化策略
憑藉其動態工作流構建能力,Qwen3.8‑Max 能將一次對話轉化為端到端量化研究迴圈。從單行任務描述,它自主規劃複雜動態工作流,建構資料系統,構建基礎因子,並協調多輪貪婪迭代,同時動態分析回測並修正方向。它也平行化因子採礦:從六項橫跨經典因子家族的簡短描述,將每項分解為 50 個研究方向,派遣約 330 個子代理,完成約 6,000 次回測,並在運行中持續調整工作流。所選因子的超額夏普比率達到 0.64–1.48,IC 均為正數且範圍為 0.010 至 0.014【...】。
長時程任務表現
自主晶片設計與閉環優化
Qwen3.8‑Max 獨立完成了 GCD/RSA 加密硬體加速器的完整晶片設計流程。從最小輸入——任務描述、一個 stub RTL 工作區與一個評估腳本——它完全自主運作,管理 RTL 編輯、模擬除錯、綜合分析、冗餘定位與迴資料路徑重新架構。在一次連續運行中,它完成了約 500 次迭代與 71 次評估,橫跨 13 個關鍵里程碑,將合成的門數從 8,298 個門 減少至 678 個門(實體晶片面積減少 81 %),同時在 500 MHz 下達成時序閉合(+0.66 ns 餘量)【...】。
關鍵里程碑包括:
- 演算法重寫:模數除法器 → 迭代位移減法(8,298 → 2,010 個門,第 22 次迭代)。
- 冗餘消除與位寬修剪(2,010 → 1,304 個門,第 35–48 次迭代)。
- 註冊器與控制 FSM 修剪(1,304 → 907 個門,第 60–113 次迭代)。
- 模組融合與邏輯共用(907 → 765 個門,第 170–252 次迭代)。
- 門級精煉(765 → 678 個門,第 443–500 次迭代)。
透過 OpenROAD 進行實體佈局驗證顯示,晶片面積從 106×106 µm² 減少至 46×46 µm²,線長從 33,369 µm 減少至 4,187 µm,並成功達成時序閉合。
長期運營中的持續學習(電子商務基準)
在 365 天的電子商務運營模擬基準中,Qwen3.8‑Max 初始資本為 ¥100,000,需跨 12 種店鋪類型、60 個產品類別、近 600 家供應商及 7,000 種商品管理產品選擇、供應鏈談判、庫存、動態定價與退貨處理。它在供應商談判中展現持續學習,實現逐步降價與穩定利潤增長,使談判效率隨時間擴大。它也將此經驗推廣至類似產品,而其他模型則出現平台期。
面對隱藏風險(供應商矩陣中嵌入的 152 家詐騙商家)與季節性需求波動,Qwen3.8‑Max 前期大舉投資,加速資產增長曲線,並在年底大促期間實現淨利潤超過 ¥100,000——幾乎是第二名 GLM 5.2 的 2.4 倍。最終它達到最高總餘額 ¥416,252(4.16× 報酬),超越 GLM 5.2 38 %,並相較於其前旗艦 Qwen3.7‑Max 提升 152 %【...】。
多模態代理與視覺回饋迴路
Qwen3.8‑Max 將視覺視為規劃、執行、驗證與迭代中的原生回饋迴路。它能理解並生成視覺內容,檢查自身中間結果,偵測偏差(例如電視朝錯誤方向、介面錯位),並自主修訂計畫並糾正輸出。
此能力使混合代理行為成為可能:將編碼(高效、可擴展的重負荷工作)與 GUI 操作(觸及人類所能見及觸及的領域)結合,以針對真實運行中的應用程式進行驗證。
為了衡量此能力,RecreationBench 基準橫跨五個平台(桌面 Ubuntu/macOS/Windows、行動 Android 及網頁)。模型僅將真實運行中的應用程式視為黑箱——無原始碼、無網路存取——必須透過反覆的編碼與互動回饋循環,從頭重建整個應用程式。Qwen3.8‑Max 已在此基準上展現前沿級混合代理能力【...】。
為了方便整合,Qwen‑MM‑Plugins 提供了一個擴展庫,提供圖像與影片處理、多模態記憶、動態解析支援、視覺工具使用,以及針對影片編輯、Blender、CAD 等任務的專門能力。任何現有代理工具鏈皆可透過此庫擴展為更自然的多模態原生系統。
使用者回饋與社區反應
在 Hacker News 討論中的留言凸顯了幾點:
- 有人指出 Qwen3.8‑27B 開放權重將於下週發布,這被視為重要訊息,有一則留言稱之為「這裡的真正新聞」【...】。
- 部分使用者指出 Qwen3.8‑Max‑Preview 已於 7 月 19 日 在阿里巴巴的 Token Plan、Qoder 與 QoderWork 上首次亮相,質疑 8 月 3 日的公告新增了什麼內容【...】。
- 有關成本與效率的疑問:模型支援
reasoning_effort參數(xhigh、medium、low)以調整推理深度與控制成本,人們希望它將顯著低於替代方案【...】。 - 少數留言表示在普通硬體上運行 27B 模型有困難,指出 GPU 記憶體限制【...】。
- 有關 token 與推理效率的問題被提出,請求提供基準中的 token 使用數據【...】。
- 模型的視覺能力受到讚賞,儘管有些人指出在使用它進行視覺網頁開發任務時會出現逾時問題【...】。
- 討論涉及更廣泛的影響:開放權重模型禁令窗口可能變窄、模型在蒸餾輸出中可能帶有親西方偏見、以及模型是否可被精簡為語言特定變體以供輕量本地使用【...】。
- 多位使用者對將 Qwen3.8‑Max 與 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等代理框架整合感到興奮,並分享了範例設定片段【...】。
可用性與使用方法
Qwen3.8‑Max 可透過 QwenCloud 存取,網址為 https://www.qwencloud.com/。模型權重將於下週在 Hugging Face 與 ModelScope 上開源。
API 使用
官方 API 支援 reasoning_effort 參數以在深度與成本間取捨:
xhigh(預設):適用於需要深入分析的複雜任務medium:在準確度與速度間取得平衡low:優先考慮速度與成本
preserve_thinking 預設為啟用,以獲得最佳的即用體驗。
以下是使用 OpenAI‑相容客戶端的範例呼叫:
from openai import OpenAI
import os
api_key = os.environ.get("DASHSCOPE_API_KEY
if not api_key:
raise ValueError("DASHSCOPE_API_KEY is required. Set it via: export DASHSCOPE_API_KEY='your-api-key'
)
client = OpenAI(
api_key=api_key,
base_url=os.environ.get(
"DASHSCOPE_BASE_URL",
"https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
),
)
messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]
completion = client.chat.completions.create(
model="qwen3.8-max",
messages=messages,
extra_body={
"enable_thinking": True,
# "preserve_thinking": True,
},
reasoning_effort="xhigh",
stream=True,
)
# ... process streaming chunks for reasoning_content and answer_content
更多細節可參考 API 文件。
與編碼助手整合
- Claude Code:設定
ANTHROPIC_MODEL="qwen3.8-max"並將ANTHROPIC_BASE_URL指向 QwenCloud 相容端點。 - Codex:在
~/.codex/model-catalog.local.json新增模型條目,包含slug: "qwen3.8-max"、context_window: 1000000以及適當的推理等級;然後設定~/.codex/config.toml使用 ModelStudio 提供者。 - Qoder CLI:透過
curl -fsSL https://qoder.com/install | bash安裝,然後執行qoder。 - Qwen Code:透過
npm install -g @qwen-code/qwen-code@latest安裝,然後執行qwen。 - OpenClaw:依照安裝腳本操作,設定
DASHSCOPE_API_KEY,並將~/.openclaw/openclaw.json指向 QwenCloud 端點。
結論
Qwen3.8‑Max 透過結合巨大規模(2.4 T 參數)與開放權重可用性、強大的自我演進編碼能力、廣泛的真實世界工作能力、在硬體設計與商業模擬中的長時程優化,以及多模態視覺回饋迴路,推進了自主 AI 系統的前沿。即將發布的權重,連同更小的 Qwen3.8‑27B 變體,將為社群提供強大基礎,以構建能在編碼、專業工作流程、研究及創作任務中以極少人類監督運行的代理。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch