nicolasvonluetzow/GaussianGPT

[ECCV'26 Oral] Our method creates 3D Gaussian scenes completely autoregressively, allowing for generation, completion, and outpainting with the same model.

它解决了什么问题

GaussianGPT 通过摒弃扩散模型或流匹配模型,解决了 3D 场景生成的挑战。相反,它采用完全自回归的方法生成 3D 高斯基元,实现逐步构建场景。这使得场景补全、外绘(outpainting)和可控采样等能力得以实现,这些功能比整体优化方法更自然地由自回归变换器支持。

它如何工作

该项目实现了一个两阶段流程:

  1. VQ-VAE:一个带有向量量化(vector quantization)的稀疏 3D 卷积自编码器,将 3D 高斯基元压缩为离散标记(tokens)。该模型通过 gsplat 使用重渲染损失进行训练。
  2. GPT:一个带有 3D 旋转位置编码的自回归变换器,通过预测下一个标记来建模这些标记序列。

在推理阶段,GPT 采样标记,然后由冻结的 VQ-VAE 解码回 3D 高斯基元,并使用标准的神经渲染流水线进行渲染。

适用人群

从事 3D 生成式 AI、神经渲染以及合成 3D 环境创建的研究人员和开发者。

主要亮点

  • 自回归生成:按顺序生成 3D 场景,而非一次性整体优化。
  • 灵活控制:支持外绘、场景补全和基于温度的采样。
  • 离散潜在网格:使用稀疏 3D CNN 对空间结构和外观进行标记化。
  • 可扩展架构:利用变换器的组合归纳偏置来实现 3D 场景生成。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目