open-gigaai/giga-world-policy

GigaWorld-Policy: An Efficient Action-Centered World–Action Model

해결하는 문제

로봇 정책 학습은 미래의 시각적 장면과 로봇 동작을 모두 예측하는 월드 액션 모델(WAM)에 의존하는 경우가 많습니다. 그러나 실시간 운영 중 미래 영상을 생성하면 막대한 계산 부담이 발생하여 폐루프 로봇 제어에는 너무 느려집니다.

작동 방식

GigaWorld-Policy-0.5는 행동 중심 접근법을 사용합니다. 훈련 중에는 물리적 기반을 이해하도록 밀도 높은 감독을 위해 미래의 시각적 동역학을 사용하지만, 추론 시에는 동작만을 디코딩하여 영상 생성의 필요성을 제거합니다. 더 빠른 처리를 위해 시각적 동역학과 동작 생성을 전문화된 전문가로 분리하는 Mixture-of-Transformers 아키텍처를 사용하여 동작 예측에 필요한 계산을 줄입니다. 또한 에이전트 기반 AutoResearch 파이프라인을 활용하여 훈련 설정과 하이퍼파라미터를 자동으로 최적화합니다.

대상 사용자

세계 모델의 물리적 기반을 필요로 하지만 영상 생성의 지연을 피하고자 하는 로봇 공학 연구자 및 개발자.

주요 특징

  • 저지연: 로컬 RTX 4090에서 85ms의 추론 지연을 달성.
  • 효율적인 아키텍처: 시각적 및 동작 작업을 분리하는 Mixture-of-Transformers 사용.
  • 행동 중심 추론: 런타임 시 미래 영상 생성이 필요 없음.
  • C++ 런타임: GGUF 및 ggml 백엔드를 사용한 실시간 배포를 위한 전용 C++/CUDA 런타임(wam.cpp) 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트