simchowitzlabpublic/nano-world-model
A Minimalist, Batteries-included Repository for Advancing World Model Science.
What it solves
Nano World Model 은 비디오 월드 모델을 학습하기 위한 미니멀하고 오픈소스인 프레임워크를 제공합니다. 이전 상태와 행동을 기반으로 비디오 시퀀스의 다음 프레임을 예측할 수 있는 모델을 학습, 검증, 평가하는 파이프라인을 간소화함으로써 미래 비디오 예측의 복잡성을 해결합니다.
How it works
이 프로젝트는 diffusion‑forcing 기술을 사용해 미래 비디오 프레임을 생성합니다. Hydra 기반 설정 시스템으로 관리되는 통합 파이프라인을 통해 학습과 추론을 처리합니다. 모델은 자동 회귀 방식의 장기 롤아웃을 수행할 수 있으며, 프레임을 순차적으로 예측하고 행동 주입을 통합해 예측 결과에 영향을 줄 수 있습니다. DINO‑WM, RT‑1, CSGO 등 다양한 데이터셋을 지원합니다.
Who it’s for
이 도구는 비디오 예측, 로봇용 월드 모델, 구현 지능을 연구하는 연구자와 개발자를 위해 설계되었으며, 어블레이션 실험 및 새로운 아키텍처 테스트를 위한 깔끔하고 투명한 코드베이스를 제공합니다.
Highlights
- Minimalist Design: NanoGPT에서 영감을 받아 사용 편의성과 최소한의 의존성으로 빠른 설정을 강조합니다.
- Diverse Applications: 장기 비디오 생성, MPC 스타일 플래닝(CEM 사용), 롤아웃 비디오에서 3D 포인트 클라우드 복원을 지원합니다.
- Scientific Transparency: 모델 체크포인트에 대한 완전한 오픈소스 접근과 모델 규모 및 행동 주입에 대한 헤드‑투‑헤드 어블레이션 연구를 제공합니다.
- Broad Dataset Support: 포인트 미로, 로봇 매니퓰레이션(PushT), 게임 환경(CSGO) 등 여러 환경과 호환됩니다.