ZhiChengAIR/Chengling-PWM
The first robot-native JEPA physical-world model.
해결하는 문제
Chengling은 로봇이 물리 세계의 행동 방식을 학습할 수 있도록 설계된 물리 세계 모델(PWM)입니다. 이 모델은 로봇이 실제 세계에서 실행하기 전에 시각 및 본체 감각의 원시 센서 입력과 언어 프롬프트를 기반으로 자신의 행동 결과를 예측하고 정신적으로 결과를 시뮬레이션할 수 있게 해줍니다.
작동 방식
Chengling은 에너지 기반 트랜스포머(EBT) 아키텍처를 사용합니다. 다중 시점 RGB 관측을 고정된 비전 인코더를 통해 처리하고, 트랜스포머 디코더를 통해 행동 이력과 언어 프롬프트와 융합합니다.
단일 패스로 행동을 생성하는 대신, 후보 행동 궤적의 물리적 일관성을 평가하기 위해 에너지 함수를 사용합니다. 추론 시에는 에너지 경사에 따라 낮은 에너지, 더 물리적으로 타당한 궤적을 향해 반복적인 샘플링 과정인 랑지반 다이내믹스 MCMC를 활용하여 행동을 개선합니다. StateMapper 컴포넌트는 다양한 로봇 구현체를 통합된 128차원 잠재 행동 공간으로 매핑하여, 하나의 모델로 다양한 로봇을 제어할 수 있도록 합니다.
대상 사용자
이 프로젝트는 체현형 AI를 위한 세계 모델을 개발하는 로봇 연구자 및 개발자들을 위한 것입니다. 특히 확산 기반 행동 생성의 대안을 찾는 사람들에게 적합합니다.
주요 특징
- 에너지 기반 모델링: 주변 분포를 모델링하는 대신 세계의 일관성을 직접 측정합니다.
- 정신적 시뮬레이션: 반복적인 기울기 기반 개선(랑지반 다이내믹스)을 사용하여 궤적을 상상하고 개선합니다.
- 유연한 추론: 실행 시 개선 단계 수를 조정하여 재학습 없이 속도와 품질 간의 트레이드오프를 조절할 수 있습니다.
- 다중 구현체 지원: 통합된 잠재 행동 공간을 통해 다양한 로봇 하드웨어 구성 간의 추론이 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch