KangLiao929/Puffin

Puffin Series: Towards Unified Multimodal 3D World Models

What it solves

Puffin 解決了建立能夠同時理解與生成 3D 世界的統一多模態模型的挑戰。它超越了簡單的圖像生成,透過實現以相機為中心的空間智能,讓系統能夠從任意視角與方向來理解與生成世界。

How it works

該專案包含兩個主要迭代版本:

  1. Puffin: 一個專注於以相機為中心的理解與生成的多模態統一模型。
  2. Puffin-World: 一個擴展版本,透過三個原生的 3D 世界狀態:物理、幾何與外觀來表示世界。這使得模型能夠執行從相機到世界的理解,以及從圖像或文本到 3D 世界的生成,而不需要外部的感知或重建模組。

Who it’s for

從事 3D 世界建模、空間智能以及整合視覺與 3D 空間意識的多模態 AI 研究人員與開發者。

Highlights

  • Unified Framework: 結合了理解與生成於單一模型中。
  • Native 3D States: 使用物理、幾何與外觀來表示世界。
  • Camera-Controllable: 支援根據特定相機視角與方向進行生成。
  • Large-Scale Datasets: 包含用於訓練與評估的 Puffin-4M 與 Puffin-16M 資料集。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案