physical-superintelligence-lab/Psi0

[RSS26'] Welcome to Psi-Zero, a Humanoid VLA towards Universal Humanoid Intelligence.

📚 概覽

Ψ₀ (讀作 Psi-zero) 是一個開源的 視覺語言動作 (VLA) 基礎模型,旨在實現 靈巧人型機器人的運動與操作。它首先從海量的自我中心視角影片數據中學習視覺與語言表示,接著在較小規模的真實世界遠端操作機器人數據集上進行 後訓練 (post-training),以捕捉人型機器人身體的動力學(例如 Unitree G1)。該模型可以透過僅約 80 條新軌跡進行微調,以獲取全新的全身動作技能。


🏗️ 架構 (如 README 所述)

層級 組件 角色
System-2 視覺語言骨幹網路 基於 Qwen3-VL-2B-Instruct;從相機觀察與文字指令中提取聯合視覺語言特徵。
System-1 多模態擴散變換器 (動作專家) 一個 ≈500 M 參數的基於流的擴散變換器 (受 Stable Diffusion 3 啟發),根據骨幹網路特徵預測未來的全身動作塊 (action chunks)。
System-0 基於 RL 的追蹤控制器 執行 System-1 產生的低層次下半身指令,為機器人提供穩定的物理控制。

🚀 儲存庫提供什麼

  • 模型權重 (視覺語言骨幹網路 + 擴散動作專家) 託管於 Hugging Face。
  • 數據集 – 真實世界遠端操作記錄 (9 個任務) 與模擬數據 (SIMPLE) 亦託管於 Hugging Face。
  • 端到端訓練腳本,用於:
    • 在大型自我中心視角數據集 (EgoDex, Humanoid-Everyday) 上預訓練 VLM。
    • 在機器人數據上進行動作專家的後訓練。
    • 在特定機器人 (Unitree G1) 或在 SIMPLE 模擬器中進行微調。
  • 部署工具,用於在 RTC (即時通訊) 模式 下提供模型服務,以及在機器人上運行客戶端。
  • 與 SONIC 的集成 – 一個全身控制器 (分支自 NV-Labs GR00T) 用於更進階的機器人端執行。
  • 基準測試實作 (GR00T, OpenPI π0.5, InternVLA-M1, H-RDT, EgoVLA, Diffusion Policy, ACT) 用於對比。
  • 詳盡的文檔:安裝、數據轉換 (轉換至 LeRobot 格式)、微調、評估 (開環與模擬中) 以及疑難排解。

📦 快速開始 (真實機器人)

# Clone and set up the environment (uses uv for dependency management)
git clone git@github.com:physical-superintelligence-lab/Psi0.git && cd Psi0
curl -LsSf https://astral.sh/uv/install.sh | sh   # install uv if needed
uv venv .venv-psi --python 3.10
source .venv-psi/bin/activate
GIT_LFS_SKIP_SMUDGE=1 uv sync --group serve --group viz --group psi --active
uv pip install flash_attn==2.7.4.post1 --no-build-isolation

# Verify installation
python -c "import psi; print(psi.__version__)"

微調真實任務 (例如:Hug box and move)

  1. 下載預先收集的任務數據 從 Hugging Face:
    export task=Hug_box_and_move
    hf download USC-PSI-Lab/psi-data g1_real_raw/$task.zip \
        --local-dir=$PSI_HOME/data/real_teleop_g1 --repo-type=dataset
    unzip $PSI_HOME/data/real_teleop_g1/g1_real_raw/$task.zip -d $PSI_HOME/data/real_teleop_g1/g1_real_raw/$task
    
  2. 轉換為 LeRobot 格式 (腳本會處理元數據):
    python scripts/data/raw_to_lerobot.py \
        --data-root=$PWD/data/real_teleop_g1/g1_real_raw \
        --work-dir=$PWD/data/real \
        --repo-id=psi0-real-g1 \
        --robot-type=g1 \
        --task=$task
    
  3. 微調 (根據需要調整 CUDA_VISIBLE_DEVICES):
    scripts/train/psi0/finetune-real-psi0.sh $task
    
  4. 提供服務 (RTC 模式):
    bash ./scripts/deploy/serve_psi0-rtc.sh
    
  5. 在機器人上運行客戶端
    bash ./real/scripts/deploy_psi0-rtc.sh
    

🎮 模擬工作流程 (SIMPLE)

  1. 安裝 SIMPLE (獨立安裝或作為子模組)。
  2. 下載模擬任務數據 (例如:G1WholebodyXMovePickTeleop-v0)。
  3. 使用 scripts/train/psi0/finetune-simple-psi0.sh $task 進行微調
  4. 提供服務 並運行提供的評估 Notebooks 或 CLI 腳本以獲取 Rollout 影片。

📚 數據與模型存取方式

  • 模型權重https://huggingface.co/USC-PSI-Lab/psi-model
  • 數據集 (真實與模擬)https://huggingface.co/datasets/USC-PSI-Lab/psi-data
  • 預訓練 VLM 骨幹網路 (Qwen3-VL-2B-Instruct) 會透過 scripts/predownload_qwen3vl.py 輔助腳本自動下載。

🛠️ 關鍵依賴項

  • uv – 專案中使用的快速 Python 套件管理工具。
  • flash_attn – 為大型 Transformer 模型優化的注意力機制核心。
  • LeRobot – 機器人學習管線的通用數據格式。
  • SIMPLE – 基於 MuJoCo + Isaac Sim 的人型機器人基準測試。
  • SONIC (GR00T-WholeBodyControl) – 用於真實機器人部署的選用全身控制器。

📄 授權

代碼以 Apache 2.0 授權發布 (參見 LICENSE)。模型權重亦採用 Apache 2.0,與儲存庫的授權方式一致。


📖 引用

如果您在研究中使用 Ψ₀,請引用隨附的 arXiv 論文 (arXiv:2603.12263) 並註明儲存庫。


TL;DR

Ψ₀ 是一個公開可用的、用於人型機器人的大規模視覺語言動作模型。它結合了基於 Qwen 的 VLM 與擴散風格的動作專家,提供預訓練、後訓練、微調與實時即時通訊 (RTC) 即時部署對 Unitree G1 對 Unitree G1 的 Unitree G-1 機器人進行部署的腳本,並包含一個完整的模擬器對比基準 (SIMPLE) 以及多個基準方法進行對比。

相關

  • Dispatch
  • 專案
  • Dispatch
  • 專案