nvidia-cosmos/cosmos-predict2.5
Cosmos-Predict2.5, the latest version of the Cosmos World Foundation Models (WFMs) family, specialized for simulating and predicting the future state of the world in the form of video.
NVIDIA Cosmos Predict 2.5 – 비디오 기반 세계 시뮬레이션 모델
무엇인가요 – Cosmos‑Predict 2.5는 NVIDIA의 Cosmos 플랫폼에서 제공하는 오픈소스 세계 기초 모델 (WFM)입니다. 이는 텍스트, 이미지 또는 비디오를 입력으로 받아 미래 상태의 비디오를 생성하는 확산형 생성 모델입니다. 이 모델은 물리적 AI (로보틱스, 자율주행차 시뮬레이션, 비디오 분석 등)를 위해 설계되었으며, 장면의 물리적으로 타당한 진화를 예측해야 하는 모든 시스템에 적합합니다.
왜 중요한가요 – 이전에는 별도로 처리되던 세 가지 작업을 통합합니다:
- 텍스트 → 세계 – 텍스트 설명에서 비디오 생성.
- 이미지 → 세계 – 정적인 이미지를 물리적으로 타당한 비디오로 애니메이션화.
- 비디오 → 세계 – 입력 비디오를 계속하거나 변환하여 미래 상태의 비디오로 생성. 이 세 가지 작업은 모두 동일한 백본과 동일한 Cosmos‑Reason 1 시각-언어 인코더를 사용하여 일관된 품질과 프롬프트와의 더 나은 일치를 제공합니다.
주요 기능 (README에 기술됨)
| 기능 | 세부 사항 |
|---|---|
| 모델 크기 | 2 B 파라미터 및 14 B 파라미터 체크포인트, 모두 사전학습 및 사후학습 버전을 지원. |
| 다중 모달 입력 | 텍스트 + 이미지, 텍스트 + 비디오, 또는 순수 텍스트 (증류 버전)를 수용. |
| 도메인 특화 버전 | • auto/multiview – 자율주행차 7카메라 레이아웃에 최적화. |
| • robot/action‑cond – 로봇 조작을 위한 액션 조건부 생성. | |
| • robot/multiview‑agibot – 3카메라 로봇 데이터 (AgiBot). | |
| • robot/policy – Libero 및 RoboCasa에서 학습된 정책 조건부 모델. | |
| 사후학습 레시피 | LoRA 미세조정, DMD2 증류, DreamGen 데이터셋, gr00t‑dreams 데이터셋, 커스텀 적응을 위한 스크립트 전체 레시피북. |
| 추론 유연성 | 네이티브 PyTorch 파이프라인, Diffusers 통합, Blackwell + ARM GPU 지원, 가드레일 오프로드, 다중 스토리지 자산 처리. |
| 가속화된 토크나이저 | CUDA 가속 토크나이저 및 torch.compile를 사용하여 추론 속도 향상. |
| 가드레일 | 생성된 비디오가 물리적으로 타당하고 정책 한계 내에 있도록 하는 내장 안전 검사. |
| 문서 및 예제 | 자세한 설정 가이드, 문제 해결, Jupyter 노트북, 그리고 단계별 레시피를 제공하는 전용 Cosmos‑Cookbook. |
일반적인 사용 사례
- 로보틱스 – 로봇 팔이 작업을 수행하는 현실적인 비디오를 생성하거나, 계획된 액션 시퀀스를 조건으로 하여 실행 전 결과를 평가.
- 자율주행 – 다중 카메라 입력에서 미래 교통 장면을 시뮬레이션하여 시나리오 테스트 및 데이터 증강에 활용.
- 비디오 분석 – 감시 장면의 진화 (예: 인파 이동)를 예측하여 능동적인 의사결정을 개선.
- 콘텐츠 제작 – 스토리보드나 단일 이미지를 물리적으로 일관된 짧은 비디오 클립으로 변환.
- 모델 연구 – 다중 모달 확산, 수정 흐름 학습, 생성 모델 내 물리적 추론 연구의 기준 모델로 활용.
시작하기 (README에서 요약된 빠른 시작 단계)
- 리포지토리 클론
git clone https://github.com/nvidia-cosmos/cosmos-predict2.5.git cd cosmos-predict2.5 - 의존성 설치 (리포지토리는
docs/setup.md에 conda/Docker 레시피를 제공하며, 가장 간단한 방법은 제공된 Docker 이미지 사용).# conda 사용 예시 conda create -n cosmos-predict python=3.10 conda activate cosmos-predict pip install -r requirements.txt - 모델 체크포인트 다운로드 – Hugging Face에서 크기 선택:
huggingface-cli download nvidia/Cosmos-Predict2.5-2B --repo-type model --local-dir ./models/2b/base - 기본 추론 실행 – 텍스트 프롬프트에서 비디오 생성:
from cosmos_predict import CosmosPredictPipeline pipe = CosmosPredictPipeline.from_pretrained("./models/2b/base") video = pipe("A night‑time city bus terminal slowly comes to life, buses start moving.") video.save("output.mp4") - 예제 탐색 –
examples/notebook/폴더에는 Image2World, Video2World, 로봇 액션 조건부 생성, 다중 뷰 자율주행차 시나리오용 실행 가능한 Jupyter 노트북이 포함되어 있습니다.
커뮤니티 및 기여
- Cosmos‑Cookbook – 미세조정, 증류, 배포용 완성된 레시피를 제공하는 보조 리포지토리 (
nvidia-cosmos/cosmos-cookbook). - 이슈 및 PR – 기여를 환영합니다. 워크플로우는
CONTRIBUTING.md참조. - 미래 방향성 – 개발은 Cosmos 3으로 이전 중입니다. 통합 모델로 추론, 정책 생성, 크로스모달 전이를 추가. 기존 사용자는 마이그레이션을 권장하지만, Cosmos‑Predict 2.5는 제한적인 유지보수를 계속합니다.
라이선스
- 코드 – Apache 2.0.
- 모델 가중치 – NVIDIA Open Model License (상용 친화적, 별도의 커스텀 라이선스는
cosmos-license@nvidia.com로 요청 가능).
TL;DR
Cosmos‑Predict 2.5는 NVIDIA의 오픈소스 확산 기반 비디오 생성 모델로, 텍스트, 이미지 또는 비디오에서 미래 세계 상태를 예측하는 데 사용됩니다. 2 B 및 14 B 크기로 제공되며, 로봇 및 자율주행차를 위한 도메인 특화 버전을 포함하고, 미세조정 및 배포 도구의 완전한 세트를 제공합니다. 현실적이고 제어 가능한 비디오 시뮬레이션을 필요로 하는 물리적 AI 시스템을 구축하는 연구자 및 엔지니어에게 이상적입니다.
관련
- Dispatch
- Dispatch
- Dispatch
- 프로젝트
- 프로젝트