Robbyant/lingbot-va

[RSS 2026] Causal video-action world model for generalist robot control

何を解決するか

LingBot-VAはロボット制御における同時世界モデリングとアクション推論の課題に対処します。視覚的ダイナミクス予測とアクション生成を統合することで、サンプル効率の向上、長時間の成功確率の向上、新しいシーンへの一般化能力の強化を目指しています。

動作方法

このプロジェクトは自己回帰(AR)拡散フレームワークを実装しています。視覚的ダイナミクスとアクション推論を1つのシーケンス内で交互に処理する、デュアルストリームMixture-of-Transformers(MoT)アーキテクチャを使用しています。高効率な実行を確保するため、非同期実行(Asynchronous Execution)とKVキャッシュを採用しています。システムは原始ピクセルではなく、Wan2.2 VAEで処理された動画の潜在表現を扱い、FSDPを用いた分散学習によりカスタムロボット操作データセットに対する事後学習をサポートしています。

対象ユーザー

このフレームワークは、ロボット制御、視覚的世界モデリング、エンベデッドAIに取り組むロボット研究者および開発者向けに設計されており、特にカスタム操作データセット上でモデルのファインチューニングを検討している人を対象としています。

特徴

  • 統合アーキテクチャ: 視覚的ダイナミクス予測とアクション推論を1つの交互シーケンスに統合。
  • 効率的な実行: KVキャッシュと非同期実行を備えたデュアルストリームMoTアーキテクチャを活用。
  • 高いパフォーマンス: RoboTwin 2.0およびLIBEROベンチマークで最先端の成功確率を達成。
  • カスタマイズ可能: LeRobot形式へのデータ変換と潜在表現抽出を含む、カスタムデータセットに対する事後学習の完全なパイプラインを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト