NVIDIA/cosmos-framework

Our inference and training framework to run on the Cosmos Models

解決的問題

提供一個統一的端對端框架,用於訓練與部署多模態世界模型,特別是 Cosmos 3 模型家族。透過將語言、影像、影片、音訊與動作序列等多種模態整合至單一架構中,解決管理異質模態的複雜性,適用於物理人工智慧(Physical AI)應用,如世界模擬器與動作模型。

工作原理

該框架以單一 Python 套件(cosmos_framework)組織,包含兩個主要功能路徑:

  • 訓練:使用支援 FSDP、張量平行(TP)、上下文平行(CP)與流水線平行(PP)的分散式訓練器。支援原生 DCP 檢查點,並相容多種資料集適配器,包括 JSONL、WebDataset 與 LeRobot。
  • 推論:利用 Diffusers、Transformers 與 vLLM 等後端,透過 Ray 與 Gradio 提供離線批次生成與線上服務。

適用對象

適用於從事物理人工智慧、世界模型與多模態生成式 AI 的研究人員與開發者,需要一個可擴展的系統來訓練與部署能同時處理與生成多種資料類型模型的使用者。

主要亮點

  • 多模態支援:聯合處理與生成語言、影像、影片、音訊與動作序列。
  • 統一架構:採用混合 Transformer 架構,整合視覺-語言模型與世界模擬器。
  • 可擴展訓練:內建對高階分散式訓練策略(FSDP/TP/CP/PP)的支援。
  • 靈活推論:支援多種後端,並提供用於動作型模型的策略伺服器。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案