Robbyant/lingbot-va

[RSS 2026] Causal video-action world model for generalist robot control

解决的问题

LingBot-VA 解决了机器人控制中同时进行世界建模和动作推断的挑战。通过统一视觉动态预测和动作生成,旨在提升样本效率、长时程成功率,并增强机器人在新场景中的泛化能力。

工作原理

该项目实现了一个自回归(AR)扩散框架。它采用双流混合变换器(MoT)架构,将视觉动态和动作推断在单个序列中交错处理。为确保高效执行,采用了异步执行(Asynchronous Execution)和 KV 缓存。系统基于视频潜在表示(通过 Wan2.2 VAE 处理)运行,而非原始像素,并支持使用 FSDP 进行分布式训练,对自定义机器人操作数据集进行后训练。

适用对象

该框架专为从事机器人控制、视觉世界建模和具身人工智能的机器人研究人员和开发者设计,特别适合希望在自定义操作数据集上微调模型的用户。

主要亮点

  • 统一架构:将视觉动态预测与动作推断整合到一个交错序列中。
  • 高效执行:采用双流 MoT 架构,结合 KV 缓存与异步执行。
  • 高性能:在 RoboTwin 2.0 和 LIBERO 基准测试中达到最先进水平的成功率。
  • 可定制化:提供完整的后训练流程,包括数据转换为 LeRobot 格式和潜在表示提取。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目