QwenLM/Qwen-AgentWorld
Qwen-AgentWorld: Language World Models for General Agents
解決的問題
Qwen-AgentWorld 旨在模擬代理環境,使 AI 代理無需訪問真實世界系統即可進行訓練或測試。它透過提供各種數位環境的高保真、可控模擬,解決了代理訓練擴展性的問題,可用於生成強化學習 (RL) 的合成數據,並提高代理在域內和域外任務中的表現。
工作原理
這是一個基於超過 1,000 萬條真實世界互動軌跡訓練的原生語言世界模型。該模型採用三階段訓練流水線:
- CPT (Continual Pre-training): 注入環境知識。
- SFT (Supervised Fine-Tuning): 透過長思維鏈激活下一狀態預測推理。
- RL (Reinforcement Learning): 提高模擬保真度。
與傳統模擬器不同,它是一個可以模擬七個統一領域(MCP、Search、Terminal、SWE (軟體工程)、Android、Web 和 OS)的單一模型。
適用對象
本專案面向構建自主代理的 AI 研究人員和開發人員,他們需要一個可擴展、可控的環境進行訓練 (Sim RL) 和評估 (AgentWorldBench),而無需承擔與即時系統互動的風險或成本。
亮點
- 七個統一領域: 在一個模型中模擬 MCP、Search、Terminal、SWE、Android、Web 和 OS。
- 原生世界模型: 環境建模從一開始就是訓練目標,而不是事後添加。
- 可控模擬: 支援注入擾動或創建虛構世界,以對代理進行壓力測試。
- 代理基座模型: 作為世界模型進行訓練可以提高模型自身執行多輪工具調用任務的能力。
- AgentWorldBench: 包含一個跨七個領域的全面評估基準,在格式、事實性、一致性、真實性和品質方面進行評分。
相關
- Dispatch
- Dispatch
- 專案
- 專案
- 專案