KangLiao929/Puffin
Puffin Series: Towards Unified Multimodal 3D World Models
What it solves
Puffin 解決了建立能夠同時理解與生成 3D 世界的統一多模態模型的挑戰。它超越了簡單的圖像生成,透過實現以相機為中心的空間智能,讓系統能夠從任意視角與方向來理解與生成世界。
How it works
該專案包含兩個主要迭代版本:
- Puffin: 一個專注於以相機為中心的理解與生成的多模態統一模型。
- Puffin-World: 一個擴展版本,透過三個原生的 3D 世界狀態:物理、幾何與外觀來表示世界。這使得模型能夠執行從相機到世界的理解,以及從圖像或文本到 3D 世界的生成,而不需要外部的感知或重建模組。
Who it’s for
從事 3D 世界建模、空間智能以及整合視覺與 3D 空間意識的多模態 AI 研究人員與開發者。
Highlights
- Unified Framework: 結合了理解與生成於單一模型中。
- Native 3D States: 使用物理、幾何與外觀來表示世界。
- Camera-Controllable: 支援根據特定相機視角與方向進行生成。
- Large-Scale Datasets: 包含用於訓練與評估的 Puffin-4M 與 Puffin-16M 資料集。
相關
- 專案
- 專案
- 專案
- 專案
- 專案