nvidia-cosmos/cosmos-predict1

Cosmos-Predict1 is a collection of general-purpose world foundation models for Physical AI that can be fine-tuned into customized world models for downstream applications.

解决的问题

Cosmos-Predict1 提供专为未来状态预测设计的世界基础模型(WFMs)。它允许用户基于文本或视频提示生成未来世界状态的视觉模拟,这对于开发 Physical AI 和具身智能体至关重要。

工作原理

该项目使用两种主要模型架构来预测未来的视觉状态:

  • 基于扩散的模型:用于 Text2World 和 Video2World 生成,以及世界插值和从单个视频创建多视角片段。
  • 基于自回归的模型:用于 Video2World 生成,接收视频提示和可选的文本提示以模拟未来状态。

为支持这些模型,项目包含专门的图像和视频分词器,可将视觉数据压缩为连续的潜在向量或离散整数。此外,还提供后训练脚本,使开发者能够将预训练模型适配到特定应用。

适用人群

专为需要模拟环境、预测未来视觉结果或为具身智能体创建合成训练数据的 Physical AI 开发者和研究人员设计。

主要亮点

  • 多模态生成:支持 Text2World 和 Video2World 工作流。
  • 多样化的模型选项:提供从 4B 到 14B 参数的各种大小的扩散和自回归架构。
  • 先进的视觉工具:包含用于高帧率视频的 WorldInterpolator 和用于动态多视角片段的 Single2MultiView 功能。
  • 高效的分词:提供适用于不同分辨率图像和视频的连续与离散分词器套件。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目