mll-lab-nu/VAGEN
World model reinforcement learning for multi-turn VLM agents. RL for vision framework (NeurIPS 2025).
解決的問題
VAGEN 解決了訓練視覺語言模型(VLM)代理執行複雜多回合任務的困難。標準強化學習通常僅獎勵最終任務成功,導致獎勵稀疏,使代理難以學習環境的內在邏輯。VAGEN 透過強化代理內部的「世界模型」推理——特別是其估計當前狀態和預測未來轉移的能力——而非僅關注最終結果,來解決此問題。
工作原理
VAGEN 將多回合代理任務建模為部分可觀測馬可夫決策過程(POMDP)。它採用一種新穎的「世界建模強化學習」方法,將推理分解為兩個明確的步驟:StateEstimation(「當前狀態是什麼?」)和 TransitionModeling(「接下來會發生什麼?」)。
為訓練該模型,框架採用以下機制:
- WorldModeling Reward:由 LLM-as-Judge 提供的逐回合獎勵,用於評估推理過程。
- Bi-Level GAE:一種面向回合感知學習的信用分配機制。
- Flexible Harnesses:管理對話歷史的多種方式(拼接、不拼接、壓縮),其中「壓縮」可將長對話摘要以適應令牌預算。
- 模組化架構:環境、鉤子和訓練後端解耦(支援 vLLM 和 SGLang)。
適用對象
- 為視覺環境建構 VLM 代理的 AI 研究人員與開發者。
- 從事機器人、導航與空間推理任務(如 Sokoban、ManiSkill)的開發者。
- 尋找可擴展多回合視覺語言互動強化學習框架的 ML 工程師。
主要亮點
- 卓越性能:使用 VAGEN 訓練的 3B VLM 在五個視覺代理基準測試中超越了 GPT-5、Gemini 2.5 Pro 和 Claude 4.5。
- 模組化設計:支援使用者輕鬆整合自訂環境、優勢估計器與鉤子。
- 壓縮強化學習:透過摘要歷史記錄,實現超過上下文視窗長度的軌跡訓練。
- 廣泛模型支援:相容 Qwen2.5-VL、InternVL3.5 與 GLM-4.6V-Flash。
相關
- 專案
- 專案
- 專案
- 專案
- 專案