nicolasvonluetzow/GaussianGPT
[ECCV'26 Oral] Our method creates 3D Gaussian scenes completely autoregressively, allowing for generation, completion, and outpainting with the same model.
解決的問題
GaussianGPT 透過摒棄擴散或流匹配模型,解決了 3D 景觀生成的挑戰。相反地,它採用完全自回歸的方法來生成 3D 高斯基本元素,實現逐步構建場景。這使得場景補全、外繪(outpainting)以及可控採樣等能力得以更自然地實現,這些功能比整體優化方法更適合由自回歸變壓器支援。
工作原理
該專案實作一個兩階段流程:
- VQ-VAE:一個稀疏的 3D 卷積自編碼器搭配向量量化,將 3D 高斯基本元素壓縮為離散的標記(tokens)。此模型透過
gsplat的重渲染損失進行訓練。 - GPT:一個具有 3D 旋轉位置編碼的自回歸變壓器,透過預測下一個標記來建模這些標記序列。
在推論階段,GPT 會採樣標記,這些標記隨後由凍結的 VQ-VAE 解碼回 3D 高斯元素,並使用標準的神經渲染流程進行渲染。
適用對象
致力於 3D 生成式 AI、神經渲染以及合成 3D 環境創建的研究人員與開發者。
特色亮點
- 自回歸生成:以序列方式生成 3D 場景,而非一次性整體優化。
- 靈活控制:支援外繪、場景補全以及基於溫度的採樣。
- 離散潛在網格:使用稀疏 3D CNN 對空間結構與外觀進行標記化。
- 可擴展架構:利用變壓器的組合式先驗偏見,實現 3D 場景生成。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案