nvidia-cosmos/cosmos-rl

Cosmos-RL is a flexible and scalable Reinforcement Learning framework specialized for Physical AI applications.

해결하는 문제

Cosmos-RL은 신체적 AI 응용 프로그램을 위한 대규모 강화학습(Reinforcement Learning, RL) 훈련의 복잡성을 다루도록 설계되었으며, 몸을 가진 에이전트의 훈련에 따른 높은 계산 부담을 관리할 수 있는 확장 가능하고 유연한 프레임워크를 제공합니다.

작동 방식

이 프레임워크는 훈련 프로세스를 전문화된 역할로 분리하는 분리형 단일 컨트롤러 아키텍처를 사용합니다:

  • 정책(소비자): 훈련 인스턴스 전용 복제본.
  • 로울아웃(생산자): 생성 엔진 전용 복제본.
  • 컨트롤러: 정책과 로울아웃 복제본 간의 가중치와 로울아웃을 조율하는 효율적인 메시징 시스템.

성능을 극대화하기 위해, 여러 병렬 전략(Tensor, Sequence, Context, FSDP, Pipeline)을 지원하며, 메모리와 계산 오버헤드를 줄이기 위해 저정밀도 훈련 및 로울아웃(FP8 및 FP4)을 활용합니다.

대상 사용자

로봇공학, 자율주행차, 스마트 공간 등 물리적 AI에 종사하는 개발자 및 연구자로서, 대규모 강화학습 훈련 워크로드에 도달하고자 하는 분들을 대상으로 합니다.

주요 특징

  • 고급 병렬 처리: GPU 간에 워크로드를 분산시키기 위한 5가지 병렬 처리 방식을 지원합니다.
  • 비동기 아키텍처: 정책과 로울아웃 복제본을 분리하여 더 높은 효율성을 달성합니다.
  • 유연한 훈련: 동적 NCCL 프로세스 그룹을 사용해 GPU를 실시간으로 등록하거나 제거할 수 있어 장애 내성 보장합니다.
  • 저정밀도 지원: FP8 및 FP8/FP4 정밀도에 최적화되어 훈련과 로울아웃 속도를 가속화합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트