open-gigaai/giga-world-1
A Roadmap to Build World Models for Robot Policy Evaluation
해결하는 문제
GigaWorld-1은 로봇 정책 평가를 위해 특화된 세계 모델을 구축하고 훈련할 수 있는 프레임워크를 제공합니다. 제어 가능한 고해상도 로봇 작업 시뮬레이션 비디오를 생성하는 도전 과제를 해결하여, 연구자들이 실제 세계에 배포하기 전에 가상 환경에서 로봇 정책을 테스트할 수 있도록 합니다.
작동 방식
이 프로젝트는 WAN 아키텍처 기반의 다단계 훈련 파이프라인을 구현합니다:
- 단계 1 (제어 가능한 사전 훈련): Nano (1.3B) 및 Pro (5B) 모델을 제어 가능한 비디오 시퀀스를 생성하도록 훈련합니다.
- 단계 2 (가속 증류): DMD2를 사용하여 노이즈 제거 과정을 증류하여 추론 단계 수를 20에서 4~6으로 줄여 비디오 생성 속도를 크게 향상시킵니다.
- 데이터 파이프라인: Qwen3-VL을 사용해 캡션 생성, Depth Anything V2를 사용해 깊이 추정을 수행하여 로봇 데이터(LeRobot 스타일)를 GigaWorld 형식으로 변환합니다.
- 추론: 이미지에서 비디오(i2v) 및 텍스트에서 비디오(t2v) 생성을 지원하며, 10 FPS로 33초 롤아웃을 생성할 수 있습니다.
대상 사용자
고품질 세계 모델을 통해 로봇 정책을 평가해야 하는 로봇 연구자 및 AI 엔지니어, 또는 사용자 정의 로봇 도메인에서 세계 모델을 훈련하고자 하는 사용자를 대상으로 합니다.
주요 특징
- 이중 모델 크기: 성능과 리소스 제약 간 균형을 고려해 Nano (1.3B) 및 Pro (5B) 버전을 제공합니다.
- 효율적인 추론: 단계 2 증류를 통해 생성 단계를 4~6으로 줄여 빠른 롤아웃을 가능하게 합니다.
- 포괄적인 도구 세트: 훈련, 추론, 데이터 처리, LoRA 병합을 위한 오픈소스 워크플로우를 포함합니다.
- 도메인 적응성: 코드 변경 없이 GigaWorld 형식의 데이터만 제공하면 새로운 로봇 도메인에 쉽게 적응할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트