NVIDIA Cosmos Reason 2 릴리즈 노트 / 새로운 소식
NVIDIA는 로봇과 AI 에이전트가 물리적 세계에서 계획하고 행동하는 데 필요한 상식과 물리적 추론을 제공하도록 설계된 오픈 추론 비전‑언어 모델(VLM)인 Cosmos Reason 2를 출시했습니다. 이 모델은 현재 Physical AI Bench와 Physical Reasoning 리더보드에서 시각 이해 부문 1위 오픈 모델입니다.
기술 역량 및 개선 사항
Cosmos Reason 2는 전작에 비해 시공간 이해와 타임스탬프 정밀도를 향상시켰으며, 엣지와 클라우드 환경 모두에 유연하게 배포될 수 있도록 2B와 8B 파라미터 규모로 제공됩니다.
주요 기술 업그레이드:
- 확장된 컨텍스트 윈도우: 입력 토큰 제한이 256K로 증가했으며, 이는 Cosmos Reason 1이 지원하던 16K 토큰에 비해 큰 도약입니다.
- 향상된 시각 인식: 이제 2D/3D 포인트 위치 지정, 바운딩 박스 좌표, 궤적 데이터, 광학 문자 인식(OCR)을 지원합니다.
- 배포 유연성: 2B와 8B 모델 크기를 통해 다양한 배포 규모를 지원합니다.
물리 AI의 주요 활용 사례
Cosmos Reason 2는 물리적 환경에서 보다 자율적이고 체계적인 의사결정을 가능하게 하는 세 가지 주요 도메인에 적용됩니다.
비디오 분석 AI 에이전트
Cosmos Reason 2는 에이전트가 대용량 비디오 데이터에서 인사이트를 추출하도록 지원합니다. OCR 및 2D/3D 포인트 위치 지정 기능이 추가되어 에이전트가 비디오 내 텍스트를 해석하고 환경 조건을 평가할 수 있습니다. NVIDIA는 이러한 에이전트 개발을 가속화하기 위해 Video Search and Summarization (VSS) 청사진을 제공합니다. 예를 들어, Salesforce는 VSS 청사진과 Cosmos Reason을 VLM으로 사용해 Cobalt 로봇의 영상을 분석하고 작업장 안전 및 규정 준수를 모니터링합니다.
데이터 주석 및 비평
이 모델은 학습 데이터셋을 위한 고품질 타임스탬프 캡션 및 상세 설명 생성을 자동화합니다. Uber는 Cosmos Reason 2를 활용해 자율주행 차량(AV) 학습 데이터를 위한 검색 가능한 비디오 캡션을 생성하고 있습니다. AV 비디오 캡션 및 VQA에 대한 공동 저작 레시피에서 8B 모델은 파인튜닝 후 다음과 같은 측정 가능한 개선을 보였습니다:
- BLEU 점수: 10.6% 상승 (0.113 → 0.125).
- MCQ 기반 VQA: 0.67 퍼센트 포인트 상승 (80.18% → 80.85%).
- LingoQA: 13.8% 상승 (63.2% → 77.0%).
로봇 계획 및 추론
Cosmos Reason 2는 Vision Language Action (VLA) 모델의 추론 엔진으로 활용됩니다. 작업에서 다음 논리적 단계를 결정하는 것을 넘어, 이제 로봇 그리퍼를 위한 구체적인 궤적 좌표도 제공할 수 있습니다. Encord는 로봇공학 및 물리 AI 개발자를 지원하기 위해 Cosmos Reason 2를 Data Agent 라이브러리에 통합했습니다.
Cosmos 모델 패밀리 생태계
Cosmos Reason 2는 물리 AI를 위해 설계된 보다 넓은 모델 스위트의 일부입니다:
- Cosmos Predict 2.5: 미래 물리적 상태를 비디오 형태로 예측하는 생성 AI 모델입니다. 2억 클립으로 사전 학습되었으며, 텍스트, 이미지 또는 비디오 입력을 기반으로 최대 30초 길이의 물리적으로 일관된 비디오를 생성할 수 있습니다. 2B와 14B 규모로 제공됩니다.
- Cosmos Transfer 2.5: 비디오‑투‑월드 스타일 전송을 위한 멀티컨트롤 모델로, 다양한 환경 및 조명 조건에서 시뮬레이션을 확장하는 데 사용되며, 종종 NVIDIA Isaac Sim 또는 NVIDIA Omniverse NuRec와 함께 사용됩니다.
- NVIDIA GR00T N1.6: 인간형 로봇을 위한 오픈 추론 VLA 모델로, Cosmos Reason을 활용해 컨텍스트 이해와 전신 제어를 강화합니다.