lucidrains/pi-zero-pytorch

Implementation of π₀, the robotic foundation model architecture proposed by Physical Intelligence

解決的問題

本專案提供了 $\pi_0$ (pi-zero) 機器人基礎模型架構的 PyTorch 實作。其目標是建立一個通用的機器人策略,能夠根據視覺、語言指令以及機器人關節的當前狀態來生成動作。

工作原理

該模型基於預訓練的視覺-語言模型 (PaliGemma 2B) 構建,並整合了多種架構選擇來生成機器人動作:

  • Flow Matching: 使用 flow matching 而非傳統的 diffusion 進行策略生成,這通常更有效率。
  • Joint Attention: 採用透過 Joint Attention (來自 mmDIT) 進行的參數分離來處理多模態輸入。
  • Hybrid Attention: 利用 Flex Attention 來混合自回歸 (autoregressive) 與雙向 (bidirectional) 注意力模式。
  • Online Learning: EFPO 類別允許模型從環境中收集經驗,並以線上方式從這些記憶中學習。

適用對象

  • 尋求實作或實驗最新的最先進機器人基礎模型的機器人研究人員與博士生。
  • 建構用於機器人操作的視覺-語言-動作 (VLA) 模型的開發人員。

亮點

  • 實作了 Physical Intelligence 提出的 $\pi_0$ 架構。
  • 支援用於動作生成的 flow matching。
  • 整合了作為基礎視覺-語言模型的 PaliGemma 2B。
  • 透過 EFPO 類別內建對線上學習的支援。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案