nicolasvonluetzow/GaussianGPT
[ECCV'26 Oral] Our method creates 3D Gaussian scenes completely autoregressively, allowing for generation, completion, and outpainting with the same model.
What it solves
GaussianGPTは、拡散モデルやフローマッチングモデルから脱却することで、3Dシーン生成の課題に対処します。代わりに、3D Gaussian primitivesを生成するために完全な自己回帰的アプローチを採用しており、ステップバイステップでのシーン構築を可能にします。これにより、シーンの補完、アウトペインティング、および制御可能なサンプリングといった機能が、全体的な洗練手法よりも自己回帰的transformerにより自然にサポートされます。
How it works
このプロジェクトは、2段階のパイプラインを実装しています:
- VQ-VAE: ベクトル量子化を備えた疎な3D畳み込みオートエンコーダーが、3D Gaussian primitivesを離散的なトークンに圧縮します。これは、
gsplatを介した再レンダリング損失を用いて学習されます。 - GPT: 3D rotary positional embeddingsを備えた自己回帰的transformerが、次トークン予測を通じてこれらのトークンストリームをモデル化します。
推論時、GPTはトークンをサンプリングし、それらは凍結されたVQ-VAEによって3D Gaussiansへとデコードされ、標準的なニューラルレンダリングパイプラインを使用してレンダリングされます。
Who it’s for
3D生成AI、ニューラルレンダリング、および合成3D環境の作成に取り組む研究者や開発者。
Highlights
- Autoregressive Generation: 3Dシーンを一度に洗練させるのではなく、逐次的に生成します。
- Flexible Control: アウトペインティング、シーンの補完、および温度ベースのサンプリングをサポートします。
- Discrete Latent Grid: 空間構造と外観をトークン化するために、疎な3D CNNを使用します。
- Scalable Architecture: 3Dシーン生成のために、transformerの構成的な帰納バイアスを活用します。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト