NVIDIA/cosmos-framework
Our inference and training framework to run on the Cosmos Models
何を解決するか
言語、画像、動画、音声、行動シーケンスといった多様なモダリティを統合する単一のアーキテクチャにより、Physical AIアプリケーション(たとえば、ワールドシミュレーターや行動モデル)向けに、オムニモーダルワールドモデル(特にCosmos 3モデルファミリー)の学習とサービングを統合的に実現するエンドツーエンドフレームワークを提供します。管理の複雑さを軽減します。
動作方法
単一のPythonパッケージ(cosmos_framework)として構成され、以下の2つの主要な機能パスを備えています:
- 学習:FSDP、Tensor Parallelism(TP)、Context Parallelism(CP)、Pipeline Parallelism(PP)をサポートする分散トレーナーを使用。ネイティブな DCP チェックポイントを扱い、JSONL、WebDataset、LeRobotなど、さまざまなデータセットアダプターをサポートします。
- 推論:Diffusers、Transformers、vLLMなどのバックエンドを活用し、RayとGradioを介してオフラインバッチ生成とオンラインサービングの両方を提供します。
対象ユーザー
Physical AI、ワールドモデル、マルチモーダル生成AIに取り組む研究者や開発者向けです。複数のデータタイプを同時に処理・生成できるスケーラブルなシステムを必要とする方々に最適です。
特徴
- オムニモーダル対応:言語、画像、動画、音声、行動シーケンスを統合的に処理・生成。
- 統一されたアーキテクチャ:Mixture-of-Transformersアーキテクチャを採用し、視覚言語モデルとワールドシミュレーターを統合。
- スケーラブルな学習:FSDP/TP/CP/PPを含む高度な分散学習戦略を内蔵。
- 柔軟な推論:複数のバックエンドをサポートし、行動ベースのモデル用のポリシー・サーバーを提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト