physical-superintelligence-lab/Psi0
[RSS26'] Welcome to Psi-Zero, a Humanoid VLA towards Universal Humanoid Intelligence.
📚 개요
Ψ₀ (발음 Psi-zero)는 숙련된 휴머노이드의 이동 및 조작을 목표로 하는 오픈 소스 시각-언어-동작(VLA) 파운데이션 모델입니다. 먼저 대규모 에고센트릭(egocentric) 비디오 데이터로부터 시각 및 언어 표현을 학습한 다음, 휴머노이드 신체(예: Unitree G1)의 역학을 포착하기 위해 더 작은 규모의 실제 환경 원격 조작 로봇 데모 데이터셋으로 **사후 학습(post-training)**을 진행합니다. 이 모델은 약 80개의 새로운 궤적만으로도 새로운 전신 동작 기술을 습득하기 위해 미세 조정될 수 있습니다.
🏗️ 아키텍처 (README에 설명됨)
| 레벨 | 구성 요소 | 역할 |
|---|---|---|
| System-2 | 시각-언어 백본 | Qwen3-VL-2B-Instruct 기반; 카메라 관찰 및 텍스트 명령으로부터 결합된 시각-언어 특징을 추출합니다. |
| System-1 | 멀티모달 확산 트랜스포머 (동작 전문가) | ≈500 M 파라미터의 플로우 기반 확산 트랜스포머 (Stable Diffusion 3에서 영감을 얻음)로, 백본 특징을 조건으로 미래의 전신 동작 청크(action chunks)를 예측합니다. |
| System-0 | RL 기반 트래킹 컨트롤러 | System-1에서 생성된 저수준 하체 명령을 실행하여 로봇에 안정적인 물리적 제어를 제공합니다. |
🚀 저장소 제공 사항
- 모델 체크포인트 (시각-언어 백본 + 확산 동작 전문가)는 Hugging Face에 호스팅됩니다.
- 데이터셋 – 실제 환경 원격 조작 기록 (9개 작업) 및 시뮬레이션 데이터 (SIMPLE) 또한 Hugging Face에 호스팅됩니다. ,
- 엔드투엔드 학습 스크립트:
- 대규모 에고센트릭 데이터셋 (EgoDex, Humanoid-Everyday)에서 VLM 사전 학습.
- 로봇 데이터로 동작 전문가 사후 학습.
- 특정 로봇 (Unitree G1) 또는 SIMPLE 시뮬레이터에서 미세 조정.
- 배포 유틸리티 – RTC (실시간 통신) 모드에서 정책을 서빙하고 로봇에서 클라이언트를 실행하기 위한 도구.
- SONIC과의 통합 – 더 고급 로봇 측 실행을 위한 전신 컨트롤러 (NV-Labs GR00T에서 포크됨).
- 베이스라인 구현 (GR00T, OpenPI π0.5, InternVLA-M1, H-RDT, EgoVLA, Diffusion Policy, ACT) 비교용.
- 광범위한 문서화: 설치, 데이터 변환 (LeRobot 형식으로), 미세 조정, 평가 (open-loop 및 in-sim), 그리고 문제 해결.
📦 빠른 시작 (실제 로봇)
# Clone and set up the environment (uses uv for dependency management)
git clone git@github.com:physical-superintelligence-lab/Psi0.git && cd Psi0
curl -LsSf https://astral.sh/uv/install.sh | sh # install uv if needed
uv venv .venv-psi --python 3.10
source .venv-psi/bin/activate
GIT_LFS_SKIP_SMUDGE=1 uv sync --group serve --group viz --group psi --active
uv pip install flash_attn==2.7.4.post1 --no-build-isolation
# Verify installation
python -c "import psi; print(psi.__version__)"
실제 작업 미세 조정 (예: Hug box and move)
- Hugging Face에서 사전 수집된 작업 데이터 다운로드:
export task=Hug_box_and_move hf download USC-PSI-Lab/psi-data g1_real_raw/$task.zip \ --local-dir=$PSI_HOME/data/real_teleop_g1 --repo-type=dataset unzip $PSI_HOME/data/real_teleop_g1/g1_real_raw/$task.zip -d $PSI_HOME/data/real_teleop_g1/g1_real_raw/$task - LeRobot 형식으로 변환 (스크립트가 메타데이터를 처리함):
python scripts/data/raw_to_lerobot.py \ --data-root=$PWD/data/real_teleop_g1/g1_real_raw \ --work-dir=$PWD/data/real \ --repo-id=psi0-real-g1 \ --robot-type=g1 \ --task=$task - 미세 조정 (Fine-tune) (필요에 따라
CUDA_VISIBLE_DEVICES조정):scripts/train/psi0/finetune-real-psi0.sh $task - 정책 서빙 (RTC 모드):
bash ./scripts/deploy/serve_psi0-rtc.sh - 로봇에서 클라이언트 실행:
bash ./real/scripts/deploy_psi0-rtc.sh
🎮 시뮬레이션 워크플로우 (SIMPLE)
- SIMPLE 설치 (단독 또는 서브모듈로).
- シミュレーション 작업 데이터 다운로드 (예:
G1WholebodyXMovePickTeleop-v0). scripts/train/psi0/finetune-simple-psi0.sh $task를 사용하여 미세 조정.- 체크포인트 서빙 및 제공된 평가용 Notebooks 또는 CLI 스크립트를 실행하여 롤아웃 비디오를 획득.
📚 데이터 & 모델 액세스
- 모델 체크포인트:
https://huggingface.co/USC-PSI-Lab/psi-model - 데이터셋 (실제 & 시뮬레이션):
https://huggingface.co/datasets/USC-PSI-Lab/psi-data - 사전 학습된 VLM 백본 (Qwen3-VL-2B-Instruct)은
scripts/predownload_qwen3vl.py도우미를 통해 자동으로 다운로드됩니다.
🛠️ 주요 의존성
- uv – 저장소 전체에서 사용되는 빠른 Python 패키지 관리자.
- flash_attn – 대규모 트랜스포머 모델을 위한 최적화된 어텐션 커널.
- LeRobot – 로봇 학습 파이프라인을 위한 공통 데이터 형식.
- SIMPLE – MuJoCo + Isaac Sim 기반의 휴머노이드 벤치마크.
- SONIC (GR00T-WholeBodyControl) – 실제 로봇 배포를 위한 선택 사항인 전신 컨트롤러.
📄 라이선스
코드는 Apache 2.0 라이선스로 출시되었습니다 (see LICENSE). 모델 가중치는 또한 Apache 2.0으로 배포되어 저장소의 라이선싱을 따릅니다.
📖 인용
연구에서 Ψ₀를 사용한다면, 동반된 arXiv 논문 (arXiv:2603.12263) 및 저장소를 인용하십시오.
TL;DR
Ψ₀는 휴머노이드 로봇을 위한 공개적으로 사용 가능한 대규모 시각-언어-동작 모델입니다. Qwen-based VLM과 확산 스타일의 동작 전문가를 결합하여 Unitree G1에 대한 사전 학습, 사후 학습, 미세 조정 및 실시간 (RTC) 배포 스크립트를 제공하며, SIMPLE 시뮬레이션 벤치마크와 여러 베이스라인 방법으로 비교를 포함합니다.} }]}```json [ {
관련
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트