nvidia-cosmos/cosmos-predict2.5
Cosmos-Predict2.5, the latest version of the Cosmos World Foundation Models (WFMs) family, specialized for simulating and predicting the future state of the world in the form of video.
NVIDIA Cosmos Predict 2.5 – 基于视频的世界模拟模型
是什么 – Cosmos‑Predict 2.5 是 NVIDIA Cosmos 平台推出的开源 世界基础模型 (WFM)。它是一种扩散式生成模型,以 文本、图像或视频 作为输入,生成 未来状态的视频 预测。该模型专为 物理 AI(机器人、自动驾驶仿真、视频分析等)设计,适用于任何需要对场景未来演变进行物理上合理预测的系统。
为何重要 – 它统一了此前独立的三项任务:
- 文本→世界 – 从文本描述生成视频。
- 图像→世界 – 将静态图像动画化为合理的视频。
- 视频→世界 – 继续或转换输入视频为未来状态视频。 这三项任务共享相同的骨干网络和相同的 Cosmos‑Reason 1 视觉-语言编码器,确保一致的质量和与提示的更好对齐。
主要特性(如 README 所述)
| 特性 | 详情 |
|---|---|
| 模型大小 | 支持 2 B 参数和 14 B 参数的检查点,均包含预训练和后训练变体。 |
| 多模态输入 | 支持文本 + 图像、文本 + 视频或纯文本(蒸馏版本)。 |
| 领域特定变体 | • auto/multiview – 针对自动驾驶 7 摄像头系统优化。 |
| • robot/action‑cond – 面向机器人操作的动作条件生成。 | |
| • robot/multiview‑agibot – 3 摄像头机器人数据(AgiBot)。 | |
| • robot/policy – 在 Libero 与 RoboCasa 上训练的策略条件模型。 | |
| 后训练配方 | LoRA 微调、DMD2 蒸馏、DreamGen 数据集、gr00t‑dreams 数据集,以及用于自定义适配的完整脚本菜谱。 |
| 推理灵活性 | 原生 PyTorch 流水线、Diffusers 集成、Blackwell + ARM GPU 支持、护栏卸载、多存储资产处理。 |
| 加速分词 | 使用 CUDA 加速分词器和 torch.compile 实现更快的推理。 |
| 护栏机制 | 内置安全检查,确保生成视频在物理上合理且符合策略限制。 |
| 文档与示例 | 详细的设置指南、故障排除、Jupyter 笔记本,以及专用的 Cosmos‑Cookbook,提供分步配方。 |
典型应用场景
- 机器人 – 生成机器人臂执行任务的逼真视频,或以计划的动作序列作为条件,评估执行前的结果。
- 自动驾驶 – 从多摄像头输入模拟未来交通场景,用于场景测试和数据增强。
- 视频分析 – 预测监控场景的演变(如人群移动),以提升主动决策能力。
- 内容创作 – 将故事板或单张图像转换为短时、物理上连贯的视频片段。
- 模型研究 – 作为研究多模态扩散、修正流训练和生成模型中物理推理的基准。
快速入门(从 README 提炼的步骤)
- 克隆仓库
git clone https://github.com/nvidia-cosmos/cosmos-predict2.5.git cd cosmos-predict2.5 - 安装依赖(仓库提供
docs/setup.md中的 conda/Docker 配方;最简单的是使用提供的 Docker 镜像)。# 使用 conda 的示例 conda create -n cosmos-predict python=3.10 conda activate cosmos-predict pip install -r requirements.txt - 下载模型检查点 – 从 Hugging Face 选择一个大小下载:
huggingface-cli download nvidia/Cosmos-Predict2.5-2B --repo-type model --local-dir ./models/2b/base - 运行基本推理 – 从文本提示生成视频:
from cosmos_predict import CosmosPredictPipeline pipe = CosmosPredictPipeline.from_pretrained("./models/2b/base") video = pipe("A night‑time city bus terminal slowly comes to life, buses start moving.") video.save("output.mp4") - 探索示例 –
examples/notebook/文件夹包含可直接运行的 Jupyter 笔记本,涵盖 Image2World、Video2World、机器人动作条件生成、多视角自动驾驶场景等。
社区与贡献
- Cosmos‑Cookbook – 一个配套仓库(
nvidia-cosmos/cosmos-cookbook),提供微调、蒸馏和部署的现成配方。 - 问题与 PR – 欢迎贡献;请参阅
CONTRIBUTING.md了解工作流程。 - 未来方向 – 开发已转向 Cosmos 3,一个统一模型,支持推理、策略生成和跨模态迁移。现有用户建议迁移,但 Cosmos‑Predict 2.5 将继续获得有限维护。
许可证
- 代码 – Apache 2.0。
- 模型权重 – NVIDIA Open Model License(商业友好,可通过
cosmos-license@nvidia.com获取定制许可证)。
TL;DR
Cosmos‑Predict 2.5 是 NVIDIA 的开源、基于扩散的视频生成模型,用于从文本、图像或视频中 预测 未来世界状态。提供 2 B 和 14 B 两种尺寸,包含机器人和自动驾驶专用变体,并附带完整的微调与部署工具套件。非常适合需要真实、可控视频模拟的物理 AI 系统研究人员和工程师。
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- 项目