NVIDIA/cosmos-framework

Our inference and training framework to run on the Cosmos Models

何を解決するか

言語、画像、動画、音声、行動シーケンスといった多様なモダリティを統合する単一のアーキテクチャにより、Physical AIアプリケーション(たとえば、ワールドシミュレーターや行動モデル)向けに、オムニモーダルワールドモデル(特にCosmos 3モデルファミリー)の学習とサービングを統合的に実現するエンドツーエンドフレームワークを提供します。管理の複雑さを軽減します。

動作方法

単一のPythonパッケージ(cosmos_framework)として構成され、以下の2つの主要な機能パスを備えています:

  • 学習:FSDP、Tensor Parallelism(TP)、Context Parallelism(CP)、Pipeline Parallelism(PP)をサポートする分散トレーナーを使用。ネイティブな DCP チェックポイントを扱い、JSONL、WebDataset、LeRobotなど、さまざまなデータセットアダプターをサポートします。
  • 推論:Diffusers、Transformers、vLLMなどのバックエンドを活用し、RayとGradioを介してオフラインバッチ生成とオンラインサービングの両方を提供します。

対象ユーザー

Physical AI、ワールドモデル、マルチモーダル生成AIに取り組む研究者や開発者向けです。複数のデータタイプを同時に処理・生成できるスケーラブルなシステムを必要とする方々に最適です。

特徴

  • オムニモーダル対応:言語、画像、動画、音声、行動シーケンスを統合的に処理・生成。
  • 統一されたアーキテクチャ:Mixture-of-Transformersアーキテクチャを採用し、視覚言語モデルとワールドシミュレーターを統合。
  • スケーラブルな学習:FSDP/TP/CP/PPを含む高度な分散学習戦略を内蔵。
  • 柔軟な推論:複数のバックエンドをサポートし、行動ベースのモデル用のポリシー・サーバーを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト