nvidia-cosmos/cosmos-predict1

Cosmos-Predict1 is a collection of general-purpose world foundation models for Physical AI that can be fine-tuned into customized world models for downstream applications.

何を解決するか

Cosmos-Predict1 は、将来の状態予測に特化した世界基盤モデル(WFMs)を提供します。テキストまたは動画プロンプトに基づいて、将来の世界状態の視覚的シミュレーションを生成でき、Physical AI および体現型エージェントの開発に不可欠です。

動作方法

このプロジェクトは、将来の視覚的状態を予測するために2つの主要なモデルアーキテクチャを使用しています:

  • Diffusionベースのモデル:Text2World および Video2World の生成、世界の補間、および1つの動画からマルチビュークリップを作成するために使用されます。
  • 自己回帰ベースのモデル:動画プロンプトとオプションのテキストプロンプトを入力として、将来の状態をシミュレートします。

これらのモデルをサポートするために、プロジェクトは視覚データを連続的な潜在ベクトルまたは離散整数に圧縮する専用の画像および動画トークナイザーを提供します。また、開発者が事前学習済みモデルを特定の用途に適応できるように、ポストトレーニングスクリプトも提供しています。

対象ユーザー

環境のシミュレーション、将来の視覚的結果の予測、または体現型エージェント用の合成トレーニングデータを作成する必要がある Physical AI の開発者および研究者向けです。

主な特徴

  • マルチモーダル生成:Text2World および Video2World のワークフローをサポートします。
  • 多様なモデルオプション:4B から 14B パラメータのさまざまなサイズの Diffusion および自己回帰アーキテクチャを提供します。
  • 高度な視覚ツール:高フレームレート動画用の WorldInterpolator および動的マルチビュークリップ作成用の Single2MultiView 機能を備えています。
  • 効率的なトークナイゼーション:さまざまな解像度の画像および動画用に、連続的および離散的トークナイザーのセットを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト