nicolasvonluetzow/GaussianGPT
[ECCV'26 Oral] Our method creates 3D Gaussian scenes completely autoregressively, allowing for generation, completion, and outpainting with the same model.
它解决了什么问题
GaussianGPT 通过摒弃扩散模型或流匹配模型,解决了 3D 场景生成的挑战。相反,它采用完全自回归的方法生成 3D 高斯基元,实现逐步构建场景。这使得场景补全、外绘(outpainting)和可控采样等能力得以实现,这些功能比整体优化方法更自然地由自回归变换器支持。
它如何工作
该项目实现了一个两阶段流程:
- VQ-VAE:一个带有向量量化(vector quantization)的稀疏 3D 卷积自编码器,将 3D 高斯基元压缩为离散标记(tokens)。该模型通过
gsplat使用重渲染损失进行训练。 - GPT:一个带有 3D 旋转位置编码的自回归变换器,通过预测下一个标记来建模这些标记序列。
在推理阶段,GPT 采样标记,然后由冻结的 VQ-VAE 解码回 3D 高斯基元,并使用标准的神经渲染流水线进行渲染。
适用人群
从事 3D 生成式 AI、神经渲染以及合成 3D 环境创建的研究人员和开发者。
主要亮点
- 自回归生成:按顺序生成 3D 场景,而非一次性整体优化。
- 灵活控制:支持外绘、场景补全和基于温度的采样。
- 离散潜在网格:使用稀疏 3D CNN 对空间结构和外观进行标记化。
- 可扩展架构:利用变换器的组合归纳偏置来实现 3D 场景生成。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目