Robbyant/lingbot-vla

A Pragmatic VLA Foundation Model

解決する課題

LingBot-VLAは、ロボット制御に対して実用的かつ高性能なアプローチを提供するために設計されたVision-Language-Action (VLA) 基盤モデルです。異なるロボット構成間で汎用性を持ち、シミュレーションと現実世界の環境の両方で高い成功率でタスクを実行できるモデルの構築という課題に取り組んでいます。

仕組み

このモデルは、9種類の異なる双腕ロボット構成からの20,000時間の現実世界のデータを含む大規模なデータセットで事前学習されています。標準バージョンと、パフォーマンス向上のために深度情報を取り入れた深度蒸留(depth-distilled)バージョンの2種類が用意されています。コードベースはトレーニング効率を最適化しており、既存のVLAコードベースと比較して1.5倍から2.8倍の高速化を実現し、GPUメモリの使用量も削減されています。

対象者

このプロジェクトは、物理的なロボットやシミュレーション(RoboTwin 2.0など)にVLAモデルをデプロイしたいロボット研究者や開発者、およびカスタムロボットデータのための効率的なポストトレーニング・パイプラインを探している方を対象としています。

ハイライト

  • 大規模な事前学習: 9つのロボット構成にわたる20,000時間のデータで学習。
  • 高い効率性: 大幅なトレーニングの高速化とGPUメモリ消費の削減。
  • 深度認識オプション: 深度なしのモデルと深度蒸留モデルの両方のチェックポイントを提供。
  • 強力なベンチマーク: GM-100およびRoboTwin 2.0ベンチマークで最先端の結果を達成。
  • LeRobotとの統合: データ処理とデプロイメントのためにLeRobot v3.0と完全な互換性があります。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト