KangLiao929/Puffin

Puffin Series: Towards Unified Multimodal 3D World Models

What it solves

Puffin은 3D 세계를 이해하고 생성할 수 있는 통합형 멀티모달 모델을 구축하는 과제를 해결합니다. 단순한 이미지 생성을 넘어 카메라 중심의 공간 지능을 가능하게 하여, 시스템이 임의의 시점과 방향에서 세계를 이해하고 생성할 수 있도록 합니다.

How it works

이 프로젝트는 두 가지 주요 반복 버전으로 구성됩니다:

  1. Puffin: 카메라 중심의 이해와 생성을 위한 통합형 멀티모달 모델입니다.
  2. Puffin-Native-World: Puffin-World는 물리, 기하학, 및 외관이라는 세 가지 네이티브 3D 세계 상태를를 통해 세계를 표현합니다. 이 모델은 외부 인식이나 재구성 모듈 없이도 카메라-투-월드 이해 및 이미지-또는-텍스트-투-3D 세계 생성을 수행할 수 있습니다.

Who it’s for

3D 세계 모델링, 공간 지능, 그리고 시각과 3D 공간 인식을 통합하는 멀티모달 AI 연구원 및 개발자입니다.

Highlights

  • Unified Framework: 이해와 생성을 단일 모델에서 결합합니다.
  • Native 3D States: 물리, 기하학, 및 외관을 사용하여 세계를 표현합니다.
  • Camera-Controllable: 특정 카메라 시점과 방향에 기반한 생성을 지원합니다.
  • Large-Scale Datasets: Puffin-4M 및 Puffin-16M 데이터셋을 훈련시키고 평가하기 위해 Puffin-4M 및 Puffin-16M 데이터셋을 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트