X-Square-Robot/wall-x

Building General-Purpose Robots Based on Embodied Foundation Model

何を解決するか

Wall-X は、身体的な基礎モデルを使用して汎用ロボットを構築するためのフレームワークを提供します。視覚言語モデル(VLM)と物理的インタラクションの間のギャップを埋め、高精細なインタラクションデータに基づいてロボットが物理世界で効果的に行動する方法を理解できるようにします。

動作方法

このプロジェクトは、視覚-言語-行動(VLA)アーキテクチャを実装しています。大規模なマルチモーダル事前学習を活用して、言語と視覚を特定のロボット行動と関連付けます。システムには、フローマッチングとFAST行動ブランチを含む特別なトレーニングおよび推論スタックがあり、パフォーマンス向上のためのCUDAオペレータも利用しています。LeRobotデータフォーマットと統合されており、FSDP(Fully Sharded Data Parallel)トレーニングによるファインチューニングをサポートしています。

対象ユーザー

本フレームワークは、身体的なAIに取り組むロボット研究者および開発者を対象としており、特にリアルロボットの操作やシミュレータ評価に向けた視覚-言語-行動モデルのデプロイおよびファインチューニングを検討している人向けです。

主な特徴

  • デプロイ対応VLA:Wall-OSS-0.5モデルを含み、リアルロボット操作を直接実行可能。
  • 世界行動モデリング:将来の動画を想像する機能と行動予測を統合したWALL-WMを搭載。
  • 統合エコシステム:LeRobotデータ準備ツール、リアルタイム行動推論用WebSocketサーバー、LIBEROシミュレータ評価ツールを提供。
  • パフォーマンス最適化:FlashAttentionとカスタムCUDAオペレータを使用して、効率的な推論とトレーニングを実現。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト