KangLiao929/Puffin

Puffin Series: Towards Unified Multimodal 3D World Models

What it solves

Puffinは、3D世界を理解し、かつ生成できる統一マルチモーダルモデルの構築という課題に対処しています。単なる画像生成を超え、カメラ中心の空間知能を可能にすることで、システムが任意の視点や方向から世界を理解し、生成することを可能にします。

How it works

このプロジェクトは、主に2つの反復プロセスで構成されています:

  1. Puffin: カメラ中心の理解と生成に焦点を当てた統一マルチモーダルモデル。
  2. Puffin-World: 物理・幾何・外観という3つのネイティブな3D世界状態を通じて世界を表現する拡張版。これにより、外部の知覚や再構成モジュールをなし、カメラから世界への理解、および画像やテキストから3D世界への生成が可能になります。

Who it’s for

3D世界モデリング、空間知能、および視覚と3D空間認識を統合するマルチモーダルAIの研究者や開発者。

Highlights

  • Unified Framework: 理解と生成を単一のモデルで組み合わせます。

  • Native 3D States: 物理・幾何・外観を使用して世界を表現します。

  • Camera-Controllable: 特定のカメラ視点や方向に基づいた生成をサポートします。

  • Large-Scale Datasets: 訓練と評価のための Puffin-4M と Puffin-16M データセットを含みます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト