nvidia-cosmos/cosmos-predict1

Cosmos-Predict1 is a collection of general-purpose world foundation models for Physical AI that can be fine-tuned into customized world models for downstream applications.

解決的問題

Cosmos-Predict1 提供專為未來狀態預測設計的世界基礎模型(WFMs)。它允許使用者根據文字或影片提示生成未來世界狀態的視覺模擬,這對於開發 Physical AI 與具身智能體至關重要。

工作原理

該專案使用兩種主要模型架構來預測未來的視覺狀態:

  • 基於擴散的模型:用於 Text2World 和 Video2World 生成,以及世界插值和從單一影片創建多角度片段。
  • 基於自回歸的模型:用於 Video2World 生成,接收影片提示與可選的文字提示以模擬未來狀態。

為支援這些模型,專案包含專用的影像與影片分詞器,可將視覺資料壓縮為連續潛在向量或離散整數。此外,還提供後訓練腳本,讓開發者能將預訓練模型適應至特定應用。

適用對象

專為需要模擬環境、預測未來視覺結果,或為具身智能體創建合成訓練資料的 Physical AI 開發者與研究人員設計。

主要亮點

  • 多模態生成:支援 Text2World 與 Video2World 工作流程。
  • 多樣化的模型選項:提供從 4B 到 14B 參數的各種大小的擴散與自回歸架構。
  • 先進的視覺工具:包含用於高幀率影片的 WorldInterpolator 與用於動態多角度片段的 Single2MultiView 功能。
  • 高效分詞:提供適用於不同解析度影像與影片的連續與離散分詞器套件。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案