KangLiao929/Puffin
Puffin Series: Towards Unified Multimodal 3D World Models
What it solves
Puffinは、3D世界を理解し、かつ生成できる統一マルチモーダルモデルの構築という課題に対処しています。単なる画像生成を超え、カメラ中心の空間知能を可能にすることで、システムが任意の視点や方向から世界を理解し、生成することを可能にします。
How it works
このプロジェクトは、主に2つの反復プロセスで構成されています:
- Puffin: カメラ中心の理解と生成に焦点を当てた統一マルチモーダルモデル。
- Puffin-World: 物理・幾何・外観という3つのネイティブな3D世界状態を通じて世界を表現する拡張版。これにより、外部の知覚や再構成モジュールをなし、カメラから世界への理解、および画像やテキストから3D世界への生成が可能になります。
Who it’s for
3D世界モデリング、空間知能、および視覚と3D空間認識を統合するマルチモーダルAIの研究者や開発者。
Highlights
Unified Framework: 理解と生成を単一のモデルで組み合わせます。
Native 3D States: 物理・幾何・外観を使用して世界を表現します。
Camera-Controllable: 特定のカメラ視点や方向に基づいた生成をサポートします。
Large-Scale Datasets: 訓練と評価のための Puffin-4M と Puffin-16M データセットを含みます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト