mll-lab-nu/VAGEN

World model reinforcement learning for multi-turn VLM agents. RL for vision framework (NeurIPS 2025).

解决的问题

VAGEN 解决了训练视觉语言模型(VLM)代理执行复杂多轮任务的困难。标准强化学习通常只奖励最终任务成功,导致奖励稀疏,使代理难以学习环境的内在逻辑。VAGEN 通过强化代理内部的「世界模型」推理——特别是其估计当前状态和预测未来状态转移的能力——而非仅关注最终结果,来解决这一问题。

工作原理

VAGEN 将多轮代理任务建模为部分可观测马尔可夫决策过程(POMDP)。它采用一种新颖的「世界建模强化学习」方法,将推理分解为两个明确的步骤:StateEstimation(「当前状态是什么?」)和 TransitionModeling(「接下来会发生什么?」)。

为训练该模型,框架采用以下机制:

  • WorldModeling Reward:由 LLM-as-Judge 提供的逐轮奖励,用于评估推理过程。
  • Bi-Level GAE:一种面向轮次感知学习的信用分配机制。
  • Flexible Harnesses:管理对话历史的多种方式(拼接、不拼接、压缩),其中「压缩」可将长对话摘要以适应令牌预算。
  • 模块化架构:环境、钩子和训练后端解耦(支持 vLLM 和 SGLang)。

适用人群

  • 为视觉环境构建 VLM 代理的 AI 研究人员和开发者。
  • 从事机器人、导航和空间推理任务(如 Sokoban、ManiSkill)的开发者。
  • 寻找可扩展多轮视觉语言交互强化学习框架的 ML 工程师。

主要亮点

  • 卓越性能:使用 VAGEN 训练的 3B VLM 在五个视觉代理基准测试中超越了 GPT-5、Gemini 2.5 Pro 和 Claude 4.5。
  • 模块化设计:支持用户轻松集成自定义环境、优势估计器和钩子。
  • 压缩强化学习:通过摘要历史记录,实现超过上下文窗口长度的轨迹训练。
  • 广泛模型支持:兼容 Qwen2.5-VL、InternVL3.5 和 GLM-4.6V-Flash。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目