nvidia-cosmos/cosmos-predict2.5
Cosmos-Predict2.5, the latest version of the Cosmos World Foundation Models (WFMs) family, specialized for simulating and predicting the future state of the world in the form of video.
NVIDIA Cosmos Predict 2.5 – 基於影片的世界模擬模型
是什麼 – Cosmos‑Predict 2.5 是 NVIDIA Cosmos 平台推出的開源 世界基礎模型 (WFM)。它是一種擴散式生成模型,以 文字、影像或影片 為輸入,產生 未來狀態的影片 預測。此模型專為 物理 AI(機器人、自動駕駛車模擬、影片分析等)設計,適用於任何需要對場景未來演變進行物理上合理預測的系統。
為何重要 – 它整合了此前分離的三項任務:
- 文字→世界 – 從文字描述生成影片。
- 影像→世界 – 將靜態影像動畫化為合理的影片。
- 影片→世界 – 繼續或轉換輸入影片為未來狀態影片。 這三項任務共享相同的骨幹與相同的 Cosmos‑Reason 1 視覺-語言編碼器,確保一致的品質與提示的更好對齊。
主要特性(如 README 所述)
| 特性 | 詳細 |
|---|---|
| 模型大小 | 支援 2 B 參數與 14 B 參數的檢查點,均包含預訓練與後訓練變體。 |
| 多模態輸入 | 支援文字 + 影像、文字 + 影片或純文字(蒸餾版本)。 |
| 領域特定變體 | • auto/multiview – 對自動駕駛車 7 攝影機系統優化。 |
| • robot/action‑cond – 面向機器人操作的動作條件生成。 | |
| • robot/multiview‑agibot – 3 攝影機機器人資料(AgiBot)。 | |
| • robot/policy – 在 Libero 與 RoboCasa 上訓練的策略條件模型。 | |
| 後訓練配方 | LoRA 微調、DMD2 蒸餾、DreamGen 資料集、gr00t‑dreams 資料集,以及用於自訂適應的完整腳本菜譜。 |
| 推理彈性 | 原生 PyTorch 流水線、Diffusers 集成、Blackwell + ARM GPU 支援、護欄卸載、多儲存體資產處理。 |
| 加速分詞 | 使用 CUDA 加速分詞器與 torch.compile 以加快推理。 |
| 護欄機制 | 內建安全檢查,確保生成影片在物理上合理且符合策略限制。 |
| 文件與範例 | 詳細的設定指南、故障排除、Jupyter 筆記本,以及專用的 Cosmos‑Cookbook,提供逐步配方。 |
典型應用場景
- 機器人 – 生成機器人手臂執行任務的逼真影片,或以規劃的動作序列為條件,評估執行前的結果。
- 自動駕駛 – 從多攝影機輸入模擬未來交通場景,用於場景測試與資料增強。
- 影片分析 – 預測監控場景的演變(如人群移動),以提升主動決策能力。
- 內容創作 – 將故事板或單張影像轉換為短時、物理上連貫的影片片段。
- 模型研究 – 作為研究多模態擴散、修正流訓練與生成模型中物理推理的基準。
快速入門(從 README 提煉的步驟)
- 克隆倉儲
git clone https://github.com/nvidia-cosmos/cosmos-predict2.5.git cd cosmos-predict2.5 - 安裝相依性(倉儲提供
docs/setup.md中的 conda/Docker 配方;最簡單的是使用提供的 Docker 影像)。# 使用 conda 的範例 conda create -n cosmos-predict python=3.10 conda activate cosmos-predict pip install -r requirements.txt - 下載模型檢查點 – 從 Hugging Face 選擇一個大小下載:
huggingface-cli download nvidia/Cosmos-Predict2.5-2B --repo-type model --local-dir ./models/2b/base - 執行基本推理 – 從文字提示生成影片:
from cosmos_predict import CosmosPredictPipeline pipe = CosmosPredictPipeline.from_pretrained("./models/2b/base") video = pipe("A night‑time city bus terminal slowly comes to life, buses start moving.") video.save("output.mp4") - 探索範例 –
examples/notebook/資料夾包含可直接執行的 Jupyter 筆記本,涵蓋 Image2World、Video2World、機器人動作條件生成、多視角自動駕駛場景等。
社群與貢獻
- Cosmos‑Cookbook – 一個配套倉儲(
nvidia-cosmos/cosmos-cookbook),提供微調、蒸餾與部署的現成配方。 - 問題與 PR – 歡迎貢獻;請參閱
CONTRIBUTING.md了解工作流程。 - 未來方向 – 開發已轉向 Cosmos 3,一個統一模型,支援推理、策略生成與跨模態轉移。現有使用者建議遷移,但 Cosmos‑Predict 2.5 將繼續獲得有限維護。
授權
- 程式碼 – Apache 2.0。
- 模型權重 – NVIDIA Open Model License(商業友善,可透過
cosmos-license@nvidia.com取得自訂授權)。
TL;DR
Cosmos‑Predict 2.5 是 NVIDIA 的開源、基於擴散的影片生成模型,用於從文字、影像或影片中 預測 未來世界狀態。提供 2 B 與 14 B 兩種尺寸,包含機器人與自動駕駛專用變體,並附帶完整的微調與部署工具套件。非常適合需要真實、可控影片模擬的物理 AI 系統研究人員與工程師。
相關
- Dispatch
- Dispatch
- Dispatch
- 專案
- 專案