KangLiao929/Puffin

Puffin Series: Towards Unified Multimodal 3D World Models

它解决了什么问题

Puffin 解决了创建统一的多模态模型以理解和生成 3D 世界这一挑战。它超越了简单的图像生成,通过实现以相机为中心的空间智能,使系统能够从任意视角和方向理解并生成世界。

它如何工作

该项目包含两个主要版本:

  1. Puffin:一个专注于以相机为中心的理解和生成的统一多模态模型。
  2. Puffin-World:一个扩展版本,通过三种原生 3D 世界状态(物理、几何和外观)来表示世界。这使得模型能够在无需外部感知或重建模块的情况下,执行从相机到世界的理解,以及从图像或文本到 3D 世界生成。

适用对象

从事 3D 世界建模、空间智能以及融合视觉与 3D 空间感知的多模态 AI 的研究人员和开发者。

主要亮点

  • 统一框架:在单一模型中结合了理解和生成能力。
  • 原生 3D 状态:使用物理、几何和外观来表示世界。
  • 相机可控:支持基于特定相机视角和方向的生成。
  • 大规模数据集:包含用于训练和评估的 Puffin-4M 和 Puffin-16M 数据集。

通过原生物理、几何和外观状态,实现以相机为中心的 3D 世界理解与生成 — @puffin-ai

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目