QwenLM/Qwen-AgentWorld
Qwen-AgentWorld: Language World Models for General Agents
解决的问题
Qwen-AgentWorld 旨在模拟智能体环境,使 AI 智能体无需访问真实世界系统即可进行训练或测试。它通过提供各种数字环境的高保真、可控模拟,解决了智能体训练扩展性的问题,可用于生成强化学习 (RL) 的合成数据,并提高智能体在域内和域外任务中的表现。
工作原理
这是一个基于超过 1,000 万条真实世界交互轨迹训练的原生语言世界模型。该模型采用三阶段训练流水线:
- CPT (Continual Pre-training): 注入环境知识。
- SFT (Supervised Fine-Tuning): 通过长思维链激活下一状态预测推理。
- RL (Reinforcement Learning): 提高模拟保真度。
与传统模拟器不同,它是一个可以模拟七个统一领域(MCP、Search、Terminal、SWE (软件工程)、Android、Web 和 OS)的单一模型。
适用对象
本项目面向构建自主智能体的 AI 研究人员和开发人员,他们需要一个可扩展、可控的环境来进行训练 (Sim RL) 和评估 (AgentWorldBench),而无需承担与实时系统交互的风险或成本。
亮点
- 七个统一领域: 在一个模型中模拟 MCP、Search、Terminal、SWE、Android、Web 和 OS。
- 原生世界模型: 环境建模从一开始就是训练目标,而不是事后添加。
- 可控模拟: 支持注入扰动或创建虚构世界,以对智能体进行压力测试。
- 智能体基座模型: 作为世界模型进行训练可以提高模型自身执行多轮工具调用任务的能力。
- AgentWorldBench: 包含一个跨七个领域的全面评估基准,在格式、事实性、一致性、真实性和质量方面进行评分。
相关
- Dispatch
- Dispatch
- 项目
- 项目
- 项目