Robbyant/lingbot-va
[RSS 2026] Causal video-action world model for generalist robot control
解決的問題
LingBot-VA 解決了機器人控制中同時進行世界建模與動作推斷的挑戰。透過統一視覺動態預測與動作生成,旨在提升樣本效率、長時程成功率,並增強機器人對新場景的泛化能力。
工作原理
本專案實作了一個自回歸(AR)擴散框架。它採用雙流混合變換器(MoT)架構,將視覺動態與動作推斷在單一序列中交錯處理。為確保高效執行,採用非同步執行(Asynchronous Execution)與 KV 快取。系統基於影片潛在表示(透過 Wan2.2 VAE 處理)運作,而非原始像素,並支援使用 FSDP 進行分散式訓練,對自訂機器人操作資料集進行後訓練。
適用對象
此框架專為從事機器人控制、視覺世界建模與具身人工智慧的機器人研究人員與開發者設計,特別適合希望在自訂操作資料集上微調模型的使用者。
主要亮點
- 統一架構:將視覺動態預測與動作推斷整合至一個交錯序列中。
- 高效執行:採用雙流 MoT 架構,結合 KV 快取與非同步執行。
- 高性能量產:在 RoboTwin 2.0 與 LIBERO 基準測試中達成最尖端的成功率。
- 可客製化:提供完整的後訓練流程,包含資料轉換為 LeRobot 格式與潛在表示提取。
相關
- 專案
- 專案
- 專案
- 專案
- 專案