lucidrains/pi-zero-pytorch

Implementation of π₀, the robotic foundation model architecture proposed by Physical Intelligence

解決する課題

このプロジェクトは、$\pi_0$ (pi-zero) ロボット基盤モデルアーキテクチャのPyTorch実装を提供します。視覚、言語コマンド、およびロボットの関節の現在の状態に基づいて動作を生成できる、汎用的なロボットポリシーの作成を目的としています。

仕組み

このモデルは、学習済みの視覚言語モデル (PaliGemma 2B) に基づいて構築されており、ロボットの動作を生成するためにいくつかのアーキテクチャ上の選択を統合しています:

  • Flow Matching: ポリシー生成に従来の拡散モデル(diffusion)の代わりにflow matchingを使用しており、多くの場合、より効率的です。
  • Joint Attention: マルチモーダルな入力を処理するために、Joint Attention (mmDITより) を介したパラメータの分離を採用しています。
  • Hybrid Attention: Flex Attentionを利用して、自己回帰的(autoregressive)なアテンションパターンと双方向(bidirectional)のアテンションパターンを混合します。
  • Online Learning: EFPO クラスにより、モデルが環境から経験を収集し、それらのメモリからオンライン形式で学習することが可能になります。

対象者

  • 最新の最先端ロボット基盤モデルを実装または実験したいロボット工学の研究者や博士課程の学生。
  • ロボット操作のための視覚・言語・動作 (VLA) モデルを構築している開発者。

ハイライト

  • Physical Intelligenceによって提案された $\pi_0$ アーキテクチャの実装。
  • 動作生成のためのflow matchingのサポート。
  • ベースとなる視覚言語モデルとしてのPaliGemma 2Bとの統合。
  • EFPO クラスによるオンライン学習の組み込みサポート。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト