nvidia-cosmos/cosmos-predict1

Cosmos-Predict1 is a collection of general-purpose world foundation models for Physical AI that can be fine-tuned into customized world models for downstream applications.

해결하는 문제

Cosmos-Predict1은 미래 상태 예측을 위한 세계 기반 모델(WFMs)을 제공합니다. 텍스트 또는 비디오 프롬프트를 기반으로 미래 세계 상태의 시각적 시뮬레이션을 생성할 수 있어, Physical AI 및 몸체 기반 에이전트 개발에 필수적입니다.

작동 방식

이 프로젝트는 미래 시각 상태를 예측하기 위해 두 가지 주요 모델 아키텍처를 사용합니다:

  • Diffusion 기반 모델: Text2World 및 Video2World 생성, 세계 보간, 단일 비디오에서 다중 뷰 클립 생성에 사용됩니다.
  • 자기회귀 기반 모델: 비디오 프롬프트와 선택적 텍스트 프롬프트를 입력으로 받아 미래 상태를 시뮬레이션합니다.

이러한 모델을 지원하기 위해, 시각 데이터를 연속 잠재 벡터 또는 이산 정수로 압축하는 전용 이미지 및 비디오 토크나이저를 제공합니다. 또한 개발자가 사전 학습된 모델을 특정 응용에 맞게 적응시킬 수 있도록 포스트 트레이닝 스크립트도 제공합니다.

대상 사용자

환경 시뮬레이션, 미래 시각 결과 예측, 또는 몸체 기반 에이전트를 위한 합성 학습 데이터를 생성해야 하는 Physical AI 개발자 및 연구자에게 적합합니다.

주요 특징

  • 다중 모달 생성: Text2World 및 Video2World 워크플로우를 지원합니다.
  • 다양한 모델 옵션: 4B에서 14B 파라미터까지 다양한 크기의 Diffusion 및 자기회귀 아키텍처를 제공합니다.
  • 고급 시각 도구: 고프레임레이트 비디오용 WorldInterpolator 및 동적 다중 뷰 클립 생성용 Single2MultiView 기능을 포함합니다.
  • 효율적인 토크나이제이션: 다양한 해상도의 이미지 및 비디오용 연속 및 이산 토크나이저 세트를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트