Hugging Face AI 用於遊戲開發:3D 資產生成

TL;DR

文字轉 3D AI 目前尚未實用於即時的遊戲開發工作流程,因為產生的輸出並非「可直接用於遊戲」的。雖然有多個研究模型能生成 3D 表徵,但它們通常需要大量手動後處理才能轉換為可用的遊戲網格。

文字轉 3D 的現況

雖然文字轉圖像工具已深度整合於遊戲開發中,文字轉 3D 仍處於早期階段。目前正探索多種技術方法,以從文字描述生成 3D 資產:

  • View Synthesis and NeRFs: DreamFusion 類似的工具使用 2D 擴散生成 3D 資產,而 CLIP-NeRF 以文字與圖像驅動神經輻射場 (NeRF)。大多數現有方法依賴視圖合成——產生主體的全新視角——而非傳統的 3D 渲染。
  • Direct Mesh and Voxel Generation: CLIPMatrixCLIP-Mesh-SMPLX 直接生成帶紋理的網格,而 CLIP-Forge 則使用語言生成基於體素的模型。
  • Point Clouds: Point-EPulsar+CLIP 利用語言生成 3D 點雲。
  • Automated Texturing: Dream Textures 利用文字轉圖像的能力,自動為 Blender 中的場景添加紋理。

為何文字轉 3D 尚未達到可直接用於遊戲的階段

在遊戲開發中採用文字轉 3D 的主要障礙,是視圖合成(NeRF)與現代遊戲引擎使用的多邊形網格之間的根本差異。

NeRF 轉 網格的流程

目前已有將 NeRF 轉換為網格的相關研究(例如 NVlabs instant-ngp),但此流程類似於影像測量。它結合物件的多個視角以製作 3D 資產,然而產生的網格並非可直接在遊戲引擎中使用。

手動後處理需求

透過文字 → NeRF → 網格流程產生的資產,需要相當的專業知識與手動勞力才能達到「可直接用於遊戲」的狀態。由於這些資產的精練往往比從頭製作低多邊形資產花費更多時間,故目前不適合快速開發週期(例如在五天內完成一款遊戲)。

3D AI 生成的未來方向

為了縮小現有研究與實務遊戲開發之間的差距,已辨識出兩條主要路徑:

  1. Enhanced Mesh Generation: 改善 NeRF 轉網格的轉換與直接網格生成,以減少手動後處理需求,並產出更易於整合至引擎的資產。
  2. Direct In-Engine Rendering: 開發新型渲染技術,使 NeRF 能直接在遊戲引擎中渲染,或許可完全省去網格轉換的需求。

Sources