lucidrains/pi-zero-pytorch

Implementation of π₀, the robotic foundation model architecture proposed by Physical Intelligence

解决的问题

本项目提供了 $\pi_0$ (pi-zero) 机器人基础模型架构的 PyTorch 实现。其目标是创建一个通用的机器人策略,能够根据视觉、语言指令和机器人关节的当前状态生成动作。

工作原理

该模型基于预训练的视觉-语言模型 (PaliGemma 2B) 构建,并集成了多种架构选择来生成机器人动作:

  • Flow Matching: 使用 flow matching 而不是传统的 diffusion 进行策略生成,这通常更加高效。
  • Joint Attention: 采用通过 Joint Attention (来自 mmDIT) 进行的参数分离来处理多模态输入。
  • Hybrid Attention: 利用 Flex Attention 来混合自回归 (autoregressive) 和双向 (bidirectional) 注意力模式。
  • Online Learning: EFPO 类允许模型从环境中收集经验并以在线方式从这些记忆中学习。

适用对象

  • 寻求实现或实验最新的最先进机器人基础模型的机器人研究人员和博士生。
  • 构建用于机器人操作的视觉-语言-动作 (VLA) 模型的开发人员。

亮点

  • 实现了 Physical Intelligence 提出的 $\pi_0$ 架构。
  • 支持用于动作生成的 flow matching。
  • 集成了作为基础视觉-语言模型的 PaliGemma 2B。
  • 通过 EFPO 类内置对在线学习的支持。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目