nvidia-cosmos/cosmos-predict2.5

Cosmos-Predict2.5, the latest version of the Cosmos World Foundation Models (WFMs) family, specialized for simulating and predicting the future state of the world in the form of video.

NVIDIA Cosmos Predict 2.5 – ビデオベースの世界シミュレーションモデル

何であるか – Cosmos‑Predict 2.5 は、NVIDIA の Cosmos プラットフォームから提供されるオープンソースの 世界基礎モデル (WFM) です。これは テキスト、画像、または動画 を入力として受け取り、未来状態の動画 を生成する拡散型生成モデルです。このモデルは 物理AI(ロボット工学、自動運転車のシミュレーション、動画分析など)を目的として設計されており、シーンの物理的に妥当な進化を予測する必要があるあらゆるシステムに適しています。

なぜ重要か – これまで別々に扱われていた3つのタスクを統合しています:

  • テキスト→世界 – テキスト記述から動画を生成。
  • 画像→世界 – 静止画像を物理的に妥当な動画にアニメーション化。
  • 動画→世界 – 入力動画を継続的または変換して未来状態の動画に。 これら3つのタスクはすべて同じバックボーンと同一の Cosmos‑Reason 1 視覚言語エンコーダーを使用しており、一貫した品質とプロンプトとの良好な整合性を実現します。

主な特徴(README に記載)

特徴 詳細
モデルサイズ 2 Bパラメータおよび14 Bパラメータのチェックポイント。いずれも事前学習および事後学習バージョンをサポート。
マルチモーダル入力 テキスト + 画像、テキスト + 動画、または純粋なテキスト(蒸留版)を受容。
ドメイン特化バージョン auto/multiview – 自動運転車の7カメラリグ向けに最適化。
robot/action‑cond – ロボット操作のためのアクション条件付き生成。
robot/multiview‑agibot – 3カメラロボットデータ(AgiBot)向け。
robot/policy – Libero および RoboCasa で学習されたポリシー条件付きモデル。
事後学習レシピ LoRA微調整、DMD2蒸留、DreamGenデータセット、gr00t‑dreamsデータセット、カスタム適応用スクリプトの完全なレシピブック。
推論の柔軟性 ネイティブ PyTorch パイプライン、Diffusers 統合、Blackwell + ARM GPU 対応、ガードレールのオフロード、マルチストレージアセット処理。
高速トークナイザ CUDA加速トークナイザと torch.compile を使用して推論を高速化。
ガードレール 生成された動画が物理的に妥当であり、ポリシー制限内に収まるようにする組み込みの安全チェック。
ドキュメントと例 詳細なセットアップガイド、トラブルシューティング、Jupyter ノートブック、およびステップバイステップのレシピを提供する専用の Cosmos‑Cookbook

一般的な利用事例

  • ロボット工学 – ロボットアームがタスクを実行する現実的な動画を生成、または計画されたアクションシーケンスを条件として生成して実行前の結果を評価。
  • 自動運転 – 複数カメラからの入力から将来の交通シーンをシミュレートし、シナリオテストやデータ拡張に活用。
  • 動画分析 – 監視シーンの進化(例:群衆の動き)を予測し、能動的な意思決定を改善。
  • コンテンツ作成 – ストーリーボードや単一の画像を、物理的に整合性のある短い動画クリップに変換。
  • モデル研究 – マルチモーダル拡散、修正フロー学習、生成モデルにおける物理的推論の研究のベースラインとして活用。

クイックスタート(README から要約)

  1. リポジトリのクローン
    git clone https://github.com/nvidia-cosmos/cosmos-predict2.5.git
    cd cosmos-predict2.5
    
  2. 依存関係のインストール(リポジトリには docs/setup.md に conda/Docker レシピが含まれており、最も簡単なのは提供されている Docker イメージ)。
    # conda を使用する例
    conda create -n cosmos-predict python=3.10
    conda activate cosmos-predict
    pip install -r requirements.txt
    
  3. モデルチェックポイントのダウンロード – Hugging Face からサイズを選択してダウンロード:
    huggingface-cli download nvidia/Cosmos-Predict2.5-2B --repo-type model --local-dir ./models/2b/base
    
  4. 基本的な推論の実行 – テキストプロンプトから動画を生成:
    from cosmos_predict import CosmosPredictPipeline
    pipe = CosmosPredictPipeline.from_pretrained("./models/2b/base")
    video = pipe("A night‑time city bus terminal slowly comes to life, buses start moving.")
    video.save("output.mp4")
    
  5. 例の探索examples/notebook/ フォルダには、Image2World、Video2World、ロボットアクション条件付き生成、マルチビュー自動運転車シナリオ用の実行可能な Jupyter ノートブックが含まれています。

コミュニティと貢献

  • Cosmos‑Cookbook – 微調整、蒸留、デプロイ用の完成済みレシピを提供する補完リポジトリ(nvidia-cosmos/cosmos-cookbook)。
  • イシューとPR – 貢献を歓迎します。ワークフローは CONTRIBUTING.md を参照。
  • 将来の方向性 – 開発は Cosmos 3 に移行中。統合モデルで推論、ポリシー生成、クロスモーダル転送を追加。既存ユーザーは移行を推奨されますが、Cosmos‑Predict 2.5 は限定的なメンテナンスを継続します。

ライセンス

  • コード – Apache 2.0。
  • モデル重み – NVIDIA Open Model License(商用に配慮したライセンス。カスタムライセンスオプションは cosmos-license@nvidia.com で別途取得可能)。

TL;DR

Cosmos‑Predict 2.5 は、NVIDIA のオープンソースで拡散ベースの動画生成モデル。テキスト、画像、または動画から未来の世界状態を 予測 するためのものです。2 B および 14 B のサイズで提供され、ロボット工学および自動運転向けのドメイン特化バージョンを備え、微調整およびデプロイツールのフルセットを装備。物理AIシステムを構築する研究者やエンジニアに最適です。

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • プロジェクト
  • プロジェクト