Robbyant/lingbot-vla-v2

From Foundation to Application

何を解決するか

LingBot-VLA 2.0 は、大規模な事前学習と信頼性の高い現実世界でのロボット応用の間のギャップを埋めるために設計された、視覚-言語-行動(VLA)基盤モデルです。異なるロボットタイプ(身体構造)とタスクにわたる一般化を実現しつつ、シミュレーションおよび現実世界の環境で高いパフォーマンスを維持する課題に対処しています。

動作方法

このモデルは、50,000時間のロボット軌道と10,000時間のエゴセントリックな人間動画を含む、合計60,000時間の大規模事前学習コーパスを使用しています。以下の主要な技術的革新を採用しています:

  • 統一された行動表現: アーム、エンドエフェクタ、グリッパー、多指ハンド、腰、頭、モバイルベースをカバーする55次元の標準状態/行動ベクトルに、多様なロボット構成をマッピングします。
  • MoE行動エキスパート: スパースなMixture-of-Experts(MoE)層を行動エキスパート内に使用し、普遍的な事前知識と専門的な身体構造/タスクパターンが共存できるようにします。
  • デュアルクエリ蒸留: LingBot-Depth と DINO-Video からの知覚クエリを蒸留することで、現在のシーンの幾何構造と将来のシーン進化(予測ダイナミクスモデリング)の両方を捉えます。

対象ユーザー

このプロジェクトは、複数のハードウェア構成で動作し、複雑な操作タスクを実行できる汎用ロボットポリシーを展開したいロボット研究者および開発者向けです。

主な特徴

  • 広範な一般化: 20種類の異なるロボット構成で構成された大規模データセットで訓練されています。
  • 拡張された行動空間: 標準的な二腕操作を超える幅広いロボット部品をサポートしています。
  • 高いパフォーマンス: GM-100二腕操作および長時間スパンモバイル操作ベンチマークにおいて、以前のバージョンおよび競合他社を上回っています。
  • 現実世界対応: シミュレーション(RoboTwin)および現実世界のロボット用のデプロイスクリプトを含み、RTX 4090Dで推論時間が約130msです。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト