NVIDIA/cosmos

NVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.

何を解決するか

NVIDIA Cosmosは、ロボット工学、自律走行車両、スマートインフラ向けに「Physical AI」を構築するためのオープンプラットフォームです。視覚言語モデル、動画生成モデル、世界行動モデルの間のギャップを埋める、物理世界を理解し生成できる統合的な世界モデルフレームワークを提供します。

動作方法

Cosmos 3は、推論用の自己回帰型Transformerと、マルチモーダル生成用の拡散型Transformerを組み合わせたMixture-of-Transformers(MoT)アーキテクチャを使用しています。主に2つのモードで動作します:

  • 推論モード:テキストおよび視覚入力を処理し、タスク計画、物理的推論、行動予測などのタスク向けにテキスト出力を生成します。
  • 生成モード:テキスト、視覚、音声、行動入力を処理し、画像、動画、同期音声、行動条件付きのロールアウトを生成します。

システムは、異なるモダリティ間で空間的・時間的整合性を維持するため、統一された3D多次元回転位置埋め込み(mRoPE)を使用しています。

対象ユーザー

  • ロボット開発者:リアルタイムのロボットポリシーおよび行動軌道の作成に使用。
  • AI研究者:世界シミュレータや合成データ生成の開発に使用。
  • 自律システムエンジニア:車両およびスマートインフラ向けの意思決定システムの構築に使用。

主な特徴

  • マルチモーダル機能:言語、画像、動画、音声、行動シーケンスを統合的に処理・生成可能。
  • 柔軟なモデルファミリー:データセンターからJetsonエッジデバイスまで、さまざまなハードウェアに対応するSuper(64B)、Nano(16B)、Edge(4B)モデルを提供。
  • 多様なワークフロー:テキスト→動画、画像→動画、動画→動画、および前方ダイナミクス(行動からの将来状態予測)をサポート。
  • 広範な統合:Diffusers、vLLM-Omni、TensorRT-LLM、SGLangと互換性があり、研究および本番環境での展開に対応。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト