NVlabs/PointWorld

PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation

해결하는 문제

PointWorld는 실제 환경("in-the-wild")에서 로봇 조작을 위한 3D 월드 모델의 확장성 문제를 해결합니다. 부분적인 RGB-D 캡처와 로봇의 행동을 기반으로 전체 3D 장면의 진화(장면 흐름)를 예측하는 방법을 제공합니다.

작동 방식

PointWorld는 환경과 로봇 동작을 모두 3D 포인트 흐름으로 표현하는 대규모 사전 훈련된 3D 월드 모델입니다. 부분적으로 관측 가능한 RGB-D 데이터에서 전체 장면의 3D 포인트 흐름을 예측합니다. 아키텍처는 DINOv3 기반의 장면 인코더 백본과 다양한 크기(소, 베이스, 대)의 Point Transformer V3 (PTv3)에서 적응된 구성 요소를 활용합니다.

대상 사용자

이 프로젝트는 3D 월드 모델, 로봇 조작, 몸을 가진 AI에 종사하는 연구자 및 개발자들을 위한 것으로, 3D 장면 흐름 예측을 위한 훈련 및 평가 파이프라인을 필요로 하는 사용자를 대상으로 합니다.

주요 특징

  • 다중 도메인 훈련: DROID(현실 세계) 및 BEHAVIOR(시뮬레이션) 데이터셋 또는 둘의 조합에서 훈련을 지원합니다.
  • 3D 포인트 흐름 표현: 관측과 동작을 모두 3D 포인트 흐름으로 간주하여 전체 장면의 진화를 예측합니다.
  • 인터랙티브 시각화: viser 기반의 실시간 3D 뷰어를 포함하여 시간에 따른 진화를 단계적으로 확인하고 모델 예측을 진짜 값과 비교할 수 있습니다.
  • 유연한 아키텍처: 성능과 자원 사용량의 균형을 고려해 소, 베이스, 대 크기의 PTv3 버전을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트