Qwen-AgentWorld 发布:面向七个领域的语言世界模型及其对通用代理的影响

TL;DR

Qwen 发布了 Qwen‑AgentWorld,这是一款原生语言世界模型,能够在单一模型中模拟七种基于文本和 GUI 的代理环境,并在全新的 AgentWorldBench 基准上实现了业界领先的仿真质量。该模型提供了两种互补的提升通用代理的方式:作为可控的强化学习模拟器,以及作为统一的基础模型,内化下一状态预测。

Qwen‑AgentWorld 概述

它是什么 – Qwen‑AgentWorld 是一种语言世界模型(LWM),通过给定当前交互历史和代理动作来预测环境的下一观察。不同于事后对通用大语言模型进行适配的以往方法,Qwen‑AgentWorld 从持续预训练(CPT)到监督微调(SFT)再到强化学习(RL)阶段,一直将环境建模作为显式目标。

范围 – 该模型覆盖七个交互领域:

  • 基于文本:终端、搜索、MCP(工具调用 API)、软件工程(IDE/代码编辑)。
  • 基于 GUI:网页浏览器、桌面操作系统、Android UI。 对于 GUI 领域,模型预测结构化的可渲染代码(HTML、可访问性树 XML、UI 层级),而非原始像素,从而实现纯文本仿真。

基准 – 除模型外,团队还发布了 AgentWorldBench,这是一套涵盖七个领域的评估套件,将每条模拟轨迹与真实环境的观测对应。评分采用由 LLM 判定的五维量表(格式、事实性、一致性、真实感、质量)。

训练流水线

1. 持续预训练(CPT)

  • 注入来自沙箱、模拟器和开源基准的超过 1000 万条真实交互轨迹的环境知识。
  • 使用专业领域知识语料库(工业控制、网络安全、法律、医学、金融、时事)扩充轨迹。
  • 应用回合级信息论损失掩码,聚焦于包含真实环境信息的回合进行学习。

2. 监督微调(SFT)

  • 使用 `` 块引入显式的下一状态预测模式。
  • 通过拒绝采样挑选高质量思考轨迹,得到 7,094 条 SFT 样本。

3. 强化学习(RL)

  • 使用 GSPO RL 提升仿真保真度。
  • 奖励结合基于量表的 LLM 判官(多维质量)和针对可程序化检查的领域的规则验证器。

在 AgentWorldBench 上的表现

模型 总体得分 显著领域
Qwen‑AgentWorld‑397B‑A17B 58.71(最高) 终端,SWE(大幅提升)
GPT‑5.4 58.25
Claude Opus 4.8
Gemini 3.1 Pro

在 35 B‑A3B 规模下,三阶段流水线将总体平均分从 47.73 提升至 56.39(+8.66 分),超过 Claude Sonnet 4.6(56.04)。提升在文本和 GUI 领域均保持一致。

新出现的推理模式

对四个文本领域的 129 条思考轨迹进行分析,发现了三种不同的模式:

  1. 审慎自我纠正 – 模型插入 “Wait!” 中断以修正中间预测,平均每回合 10.4 次中断。
  2. 信息泄漏防护 – 在搜索中,当查询与目标答案无关时,模型会隐藏答案片段,表现出类理论心智的行为。
  3. 多步因果推理 – 预测复杂流水线(例如 curl -s localhost:3000 | python3 -m json.tool)需要串联六个逻辑步骤,模型能够成功完成。

范式 I:用于 RL 的解耦模拟

为什么要模拟?

  • 可扩展性与可控性:LWM 能在无需沙箱基础设施的情况下生成无限的回合级交互,并可注入罕见或对抗性扰动。
  • 内部规划:代理可以使用世界模型在行动前进行心理模拟,这在纯策略学习中是缺失的能力。

关键发现

  • 零样本泛化:模拟 4 k 个 OpenClaw 环境(训练期间未见)在 Claw‑Eval 上提升 +4.3,在 QwenClawBench 上提升 +7.1。
  • 受控模拟的重要性:未受控的 Sim‑RL 收获甚微;加入自然语言控制指令后,MCPMark 提升 +12.3,Tool Decathlon 提升 +3.7。
  • 超越真实环境 RL:在 WideSearch 上,可控 Sim‑RL 达到 50.3% F1(第 60 步),而在实时搜索引擎上训练的 RL 为 45.6%。
  • 行为塑造:可控模拟促使代理增加 web_extractor 调用,体现对更深层片段提取的依赖。

虚构世界实验

创建 1 k 个自包含的虚构数据库迫使代理依赖模拟搜索工具。受控 Sim‑RL 将 35 B 模型的 Item‑F1 从 34.02 提升至 50.31(+16.29),Row‑F1 从 13.72 提升至 24.21(+10.49)。

范式 II:统一的代理基础模型

在此范式中,同一 LWM 同时选择动作并预测下一观察,将世界建模嵌入为元推理技能。

转移结果

在单回合、非代理 RL 任务(无工具调用)上训练 LWM,可实现对所有七个领域的多回合、工具调用基准的 跨任务泛化,包括三个分布外集合:

基准(域外) 基础得分 LWM‑RL得分 Δ
Claw‑Eval 33.3 39.6 +6.3
QwenClawBench 64.5 67.9 +3.4
BFCL v4 42.2 47.4 +5.2
WideSearch (F1 Item) 33.4 46.2 +12.8
这些提升在未对目标代理任务进行任何 RL 微调的情况下出现,表明下一状态预测可作为强大的基础技能。

部署细节

  • 模型规模:35 B‑A3B(MoE,3 B 活跃参数)和 397 B‑A17B。
  • 上下文窗口:256 K token。
  • 服务:兼容 SGLang 和 vLLM。示例命令:
# SGLang
python -m sglang.launch_server \
  --model-path Qwen/Qwen-AgentWorld-35B-A3B \
  --port 8000 \
  --tensor-parallel-size 4 \
  --context-length 262144 \
  --reasoning-parser qwen3

# vLLM
vllm serve Qwen/Qwen-AgentWorld-35B-A3B \
  --port 8000 \
  --tensor-parallel-size 4 \
  --max-model-len 262144 \
  --reasoning-parser qwen3 \
  --trust-remote-code
  • 评估流水线eval/eval.py 执行推理、基于 LLM 的评判以及五维量表的聚合。

对通用代理的意义

  1. 互补的扩展维度 – LWM 提供可控、可扩展的仿真层,补充而非取代真实环境交互。
  2. 统一推理 – 将下一状态预测嵌入代理内部,形成类似反思性规划的心理模拟能力,提升指令遵循、长上下文处理和领域知识利用。
  3. 跨域迁移 – 在多样轨迹上训练产生共享的建模技能,惠及未见领域,降低对特定领域数据的需求。
  4. 研究路线图 – Qwen‑AgentWorld 展示了仅语言的世界建模能够达到并超越前沿模型性能,为构建更强大、通用的自主代理指明了方向。

Citation

@article{zuo2026qwen,
  title   = {Qwen‑agentworld: language world models for general agents},
  author  = {Zuo, Yuxin and Xiao, Zikai and Sheng, Li and Huang, Fei and Tu, Jianhong and Liu, Yuxuan and Tang, Tianyi and Hu, Xiaomeng and Su, Yang and Lan, Qingfeng and others},
  journal = {arXiv preprint arXiv:2606.24597},
  year    = {2026}
}

Sources