NVIDIA/cosmos-framework
Our inference and training framework to run on the Cosmos Models
해결하는 문제
언어, 이미지, 비디오, 오디오, 행동 시퀀스와 같은 다양한 모달리티를 단일 아키텍처로 통합하여 Physical AI 응용 프로그램(예: 월드 시뮬레이터 및 행동 모델)을 위한 오미모달 월드 모델(특히 Cosmos 3 모델 패밀리)의 학습과 서비스를 통합적으로 제공합니다. 다양한 모달리티를 관리하는 복잡성을 해결합니다.
작동 방식
단일 Python 패키지(cosmos_framework)로 구성되며, 주요 기능 경로는 다음과 같습니다:
- 학습: FSDP, Tensor Parallelism (TP), Context Parallelism (CP), Pipeline Parallelism (PP)를 지원하는 분산 트레이너 사용. 네이티브 DCP 체크포인트를 처리하고, JSONL, WebDataset, LeRobot 등 다양한 데이터셋 어댑터를 지원합니다.
- 추론: Diffusers, Transformers, vLLM 등의 백엔드를 활용하여 Ray와 Gradio를 통해 오프라인 배치 생성 및 온라인 서비스를 모두 제공합니다.
대상 사용자
Physical AI, 월드 모델, 멀티모달 생성형 AI에 종사하는 연구자 및 개발자에게 적합합니다. 여러 데이터 유형을 동시에 처리하고 생성할 수 있는 확장 가능한 시스템이 필요한 분들께 최적입니다.
주요 특징
- 오미모달 지원: 언어, 이미지, 비디오, 오디오, 행동 시퀀스를 함께 처리하고 생성합니다.
- 통합 아키텍처: Mixture-of-Transformers 아키텍처를 사용하여 시각-언어 모델과 월드 시뮬레이터를 통합합니다.
- 확장 가능한 학습: FSDP/TP/CP/PP를 포함한 고급 분산 학습 전략을 내장하고 있습니다.
- 유연한 추론: 다양한 백엔드를 지원하며, 행동 기반 모델용 정책 서버를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트