physical-superintelligence-lab/Psi0
[RSS26'] Welcome to Psi-Zero, a Humanoid VLA towards Universal Humanoid Intelligence.
📚 概覽
Ψ₀ (讀作 Psi-zero) 是一個開源的 視覺語言動作 (VLA) 基礎模型,旨在實現 靈巧人型機器人的運動與操作。它首先從海量的自我中心視角影片數據中學習視覺與語言表示,接著在較小規模的真實世界遠端操作機器人數據集上進行 後訓練 (post-training),以捕捉人型機器人身體的動力學(例如 Unitree G1)。該模型可以透過僅約 80 條新軌跡進行微調,以獲取全新的全身動作技能。
🏗️ 架構 (如 README 所述)
| 層級 | 組件 | 角色 |
|---|---|---|
| System-2 | 視覺語言骨幹網路 | 基於 Qwen3-VL-2B-Instruct;從相機觀察與文字指令中提取聯合視覺語言特徵。 |
| System-1 | 多模態擴散變換器 (動作專家) | 一個 ≈500 M 參數的基於流的擴散變換器 (受 Stable Diffusion 3 啟發),根據骨幹網路特徵預測未來的全身動作塊 (action chunks)。 |
| System-0 | 基於 RL 的追蹤控制器 | 執行 System-1 產生的低層次下半身指令,為機器人提供穩定的物理控制。 |
🚀 儲存庫提供什麼
- 模型權重 (視覺語言骨幹網路 + 擴散動作專家) 託管於 Hugging Face。
- 數據集 – 真實世界遠端操作記錄 (9 個任務) 與模擬數據 (SIMPLE) 亦託管於 Hugging Face。
- 端到端訓練腳本,用於:
- 在大型自我中心視角數據集 (EgoDex, Humanoid-Everyday) 上預訓練 VLM。
- 在機器人數據上進行動作專家的後訓練。
- 在特定機器人 (Unitree G1) 或在 SIMPLE 模擬器中進行微調。
- 部署工具,用於在 RTC (即時通訊) 模式 下提供模型服務,以及在機器人上運行客戶端。
- 與 SONIC 的集成 – 一個全身控制器 (分支自 NV-Labs GR00T) 用於更進階的機器人端執行。
- 基準測試實作 (GR00T, OpenPI π0.5, InternVLA-M1, H-RDT, EgoVLA, Diffusion Policy, ACT) 用於對比。
- 詳盡的文檔:安裝、數據轉換 (轉換至 LeRobot 格式)、微調、評估 (開環與模擬中) 以及疑難排解。
📦 快速開始 (真實機器人)
# Clone and set up the environment (uses uv for dependency management)
git clone git@github.com:physical-superintelligence-lab/Psi0.git && cd Psi0
curl -LsSf https://astral.sh/uv/install.sh | sh # install uv if needed
uv venv .venv-psi --python 3.10
source .venv-psi/bin/activate
GIT_LFS_SKIP_SMUDGE=1 uv sync --group serve --group viz --group psi --active
uv pip install flash_attn==2.7.4.post1 --no-build-isolation
# Verify installation
python -c "import psi; print(psi.__version__)"
微調真實任務 (例如:Hug box and move)
- 下載預先收集的任務數據 從 Hugging Face:
export task=Hug_box_and_move hf download USC-PSI-Lab/psi-data g1_real_raw/$task.zip \ --local-dir=$PSI_HOME/data/real_teleop_g1 --repo-type=dataset unzip $PSI_HOME/data/real_teleop_g1/g1_real_raw/$task.zip -d $PSI_HOME/data/real_teleop_g1/g1_real_raw/$task - 轉換為 LeRobot 格式 (腳本會處理元數據):
python scripts/data/raw_to_lerobot.py \ --data-root=$PWD/data/real_teleop_g1/g1_real_raw \ --work-dir=$PWD/data/real \ --repo-id=psi0-real-g1 \ --robot-type=g1 \ --task=$task - 微調 (根據需要調整
CUDA_VISIBLE_DEVICES):scripts/train/psi0/finetune-real-psi0.sh $task - 提供服務 (RTC 模式):
bash ./scripts/deploy/serve_psi0-rtc.sh - 在機器人上運行客戶端:
bash ./real/scripts/deploy_psi0-rtc.sh
🎮 模擬工作流程 (SIMPLE)
- 安裝 SIMPLE (獨立安裝或作為子模組)。
- 下載模擬任務數據 (例如:
G1WholebodyXMovePickTeleop-v0)。 - 使用
scripts/train/psi0/finetune-simple-psi0.sh $task進行微調。 - 提供服務 並運行提供的評估 Notebooks 或 CLI 腳本以獲取 Rollout 影片。
📚 數據與模型存取方式
- 模型權重:
https://huggingface.co/USC-PSI-Lab/psi-model - 數據集 (真實與模擬):
https://huggingface.co/datasets/USC-PSI-Lab/psi-data - 預訓練 VLM 骨幹網路 (Qwen3-VL-2B-Instruct) 會透過
scripts/predownload_qwen3vl.py輔助腳本自動下載。
🛠️ 關鍵依賴項
- uv – 專案中使用的快速 Python 套件管理工具。
- flash_attn – 為大型 Transformer 模型優化的注意力機制核心。
- LeRobot – 機器人學習管線的通用數據格式。
- SIMPLE – 基於 MuJoCo + Isaac Sim 的人型機器人基準測試。
- SONIC (GR00T-WholeBodyControl) – 用於真實機器人部署的選用全身控制器。
📄 授權
代碼以 Apache 2.0 授權發布 (參見 LICENSE)。模型權重亦採用 Apache 2.0,與儲存庫的授權方式一致。
📖 引用
如果您在研究中使用 Ψ₀,請引用隨附的 arXiv 論文 (arXiv:2603.12263) 並註明儲存庫。
TL;DR
Ψ₀ 是一個公開可用的、用於人型機器人的大規模視覺語言動作模型。它結合了基於 Qwen 的 VLM 與擴散風格的動作專家,提供預訓練、後訓練、微調與實時即時通訊 (RTC) 即時部署對 Unitree G1 對 Unitree G1 的 Unitree G-1 機器人進行部署的腳本,並包含一個完整的模擬器對比基準 (SIMPLE) 以及多個基準方法進行對比。
相關
- Dispatch
- 專案
- Dispatch
- 專案