Qwen-AgentWorld 發布:七個領域的語言世界模型及其對通用代理的影響
TL;DR
Qwen 發布 Qwen‑AgentWorld,一個原生語言世界模型,能在單一模型內模擬七種文字與 GUI 為基礎的代理環境,並在全新 AgentWorldBench 基準上達到最先進的模擬品質。該模型提供兩種互補的方式來提升通用代理:作為強化學習的可控模擬器,以及作為內化下一狀態預測的統一基礎模型。
Qwen‑AgentWorld 概述
What it is – Qwen‑AgentWorld 是一種語言世界模型(LWM),訓練目標是根據當前互動歷史與代理的行動,預測環境的下一個觀測。不同於先前在事後調整通用大型語言模型(LLM)的做法,Qwen‑AgentWorld 從持續預訓練(CPT)開始,透過監督式微調(SFT)與強化學習(RL)將環境建模作為明確目標納入。
Scope – 該模型涵蓋七個互動領域:
- 文字為基礎:Terminal、Search、MCP(工具呼叫 API)、Software‑Engineering(IDE/程式碼編輯)。
- GUI 為基礎:Web 瀏覽器、Desktop OS、Android UI。 對於 GUI 領域,模型預測結構化可渲染的程式碼(HTML、accessibility‑tree XML、UI 階層),而非原始像素,從而允許純文字模擬。
Benchmarks – 除了模型外,團隊同時發布 AgentWorldBench,這是一套涵蓋七個領域的評估套件,將每條模擬軌跡與真實環境的觀測配對。評分使用五維度量表(格式、事實性、一致性、真實感、品質),由 LLM 判斷。
訓練流程
1. 持續預訓練(CPT)
- 注入來自超過 10 M 真實互動軌跡的環境知識,這些軌跡來自沙盒、模擬器與開源基準。
- 使用專門的世界知識語料庫(工業控制、網路安全、法律、醫學、金融、時事)增強軌跡。
- 應用回合層級資訊理論損失遮蔽,聚焦於包含真實環境資訊的回合進行學習。
2. 監督式微調(SFT)
- 引入使用 `` 區塊的明確下一狀態預測模式。
- 透過拒絕抽樣挑選高品質思考軌跡,產生 7,094 筆 SFT 樣本。
3. 強化學習(RL)
- 使用 GSPO RL 提升忠實度。
- 獎勵結合基於量表的 LLM 評審(多維度品質)與規則式驗證器,適用於可程式化檢查精確正確性的領域。
AgentWorldBench 上的效能
| 模型 | 總分 | 顯著領域 |
|---|---|---|
| Qwen‑AgentWorld‑397B‑A17B | 58.71 (最高) | Terminal、SWE(大幅提升) |
| GPT‑5.4 | 58.25 | – |
| Claude Opus 4.8 | – | – |
| Gemini 3.1 Pro | – | – |
在 35 B‑A3B 規模下,三階段流程將總體平均分從 47.73 提升至 56.39(+8.66 分),超過 Claude Sonnet 4.6(56.04)。此提升在文字與 GUI 兩個領域皆保持一致。
新興推理模式
對四個文字領域的 129 條思考軌跡分析顯示出三種不同的模式:
- Deliberative self‑correction – 模型插入「Wait!」中斷以修正中間預測,平均每回合有 10.4 次中斷。
- Information leakage prevention – 在 Search 中,當查詢與目標答案無關時,模型會隱藏目標答案片段,模仿心智理論的行為。
- Multi‑step causal reasoning – 預測複雜的管道(例如
curl -s localhost:3000 | python3 -m json.tool)需要串接六個邏輯步驟,模型成功完成。
範式 I:為 RL 解耦模擬
為何要模擬?
- Scalability & controllability:LWM 能產生無限的回合層級互動,無需沙盒基礎設施,且可注入稀有或對抗性擾動。
- Internal planning:代理可以使用世界模型在行動前進行心智模擬,這是純策略學習所缺乏的能力。
主要發現
- Zero‑shot generalization:模擬 4 k OpenClaw 環境(訓練時未見)在 Claw‑Eval 上提升 +4.3,於 QwenClawBench 上提升 +7.1。
- Controlled simulation matters:未受控的 Sim‑RL 只帶來微不足道的提升;加入自然語言控制指令後,MCPMark 提升 +12.3,Tool Decathlon 提升 +3.7。
- Surpassing real‑environment RL:在 WideSearch 上,可控 Sim‑RL 達到 50.3 % F1(第 60 步),相較於在實時搜尋引擎上訓練的 RL 為 45.6 %。
- Behavioral shaping:可控模擬促使代理增加
web_extractor呼叫,顯示其學會依賴更深入的片段提取。
虛構世界實驗
建立 1 k 自包含的虛構資料庫迫使代理依賴模擬搜尋工具。對 35 B 模型而言,可控 Sim‑RL 將 Item‑F1 從 34.02 提升至 50.31(+16.29),Row‑F1 從 13.72 提升至 24.21(+10.49)。
範式 II:統一代理基礎模型
在此範式中,同一個 LWM 同時選擇行動與預測下一個觀測,將世界建模嵌入為元推理技能。
轉移結果
在單回合、非代理式 RL 任務(無工具呼叫)上訓練 LWM,即可產生 跨任務泛化,適用於所有七個領域的多回合、工具呼叫基準,亦包括三個分布外集合:
| 基準(分布外) | 基礎分數 | LWM‑RL 分數 | Δ |
|---|---|---|---|
| Claw‑Eval | 33.3 | 39.6 | +6.3 |
| QwenClawBench | 64.5 | 67.9 | +3.4 |
| BFCL v4 | 42.2 | 47.4 | +5.2 |
| WideSearch (F1 Item) | 33.4 | 46.2 | +12.8 |
| … | … | … | … |
這些提升在未對目標代理任務進行任何 RL 微調的情況下產生,證明下一狀態預測可作為強大的基礎技能。
部署細節
- 模型規模:35 B‑A3B(MoE,3 B 活躍參數)與 397 B‑A17B。
- 上下文窗口:256 K 令牌。
- 服務:相容於 SGLang 與 vLLM。範例指令:
# SGLang
python -m sglang.launch_server \
--model-path Qwen/Qwen-AgentWorld-35B-A3B \
--port 8000 \
--tensor-parallel-size 4 \
--context-length 262144 \
--reasoning-parser qwen3
# vLLM
vllm serve Qwen/Qwen-AgentWorld-35B-A3B \
--port 8000 \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--trust-remote-code
- 評估流程:
eval/eval.py執行推論、基於 LLM 的評審,並在五個量表維度上彙總。
對通用代理的影響
- Complementary scaling axis – LWM 提供可控且可擴展的模擬層,補強而非取代真實環境互動。
- Unified reasoning – 將下一狀態預測嵌入代理內部,形成類似反思規劃的心智模擬能力,增強指令遵循、長上下文處理與領域知識運用。
- Cross‑domain transfer – 在多樣軌跡上訓練可培養共享的建模技能,惠及未見領域,降低對領域特定資料的需求。
- Research roadmap – Qwen‑AgentWorld 證明僅使用語言的世界建模即可達到甚至超越前沿模型表現,為打造更強大、通用的自主代理鋪平道路。
引用
@article{zuo2026qwen,
title = {Qwen‑agentworld: language world models for general agents},
author = {Zuo, Yuxin and Xiao, Zikai and Sheng, Li and Huang, Fei and Tu, Jianhong and Liu, Yuxuan and Tang, Tianyi and Hu, Xiaomeng and Su, Yang and Lan, Qingfeng and others},
journal = {arXiv preprint arXiv:2606.24597},
year = {2026}
}