Hugging Face AI 用于游戏开发:3D 资产生成

TL;DR

文本到 3D AI 目前尚不适用于游戏开发工作流的即时使用,因为生成的输出并非“可直接用于游戏”。虽然有多个研究模型能够生成 3D 表示,但它们通常需要大量手动后处理才能转换为可用的游戏网格。

文本到 3D 的现状

虽然文本到图像工具已深度融入游戏开发,文本到 3D 仍处于早期阶段。目前正在探索多种技术方法,以从文本描述生成 3D 资产:

  • 视图合成与 NeRF:像 DreamFusion 这样的工具使用 2D 扩散生成 3D 资产,CLIP-NeRF 则通过文本和图像驱动神经辐射场(NeRF)。大多数当前方法依赖视图合成——为主体生成新视角——而非传统的 3D 渲染。
  • 直接网格与体素生成CLIPMatrixCLIP-Mesh-SMPLX 直接生成带纹理的网格,而 CLIP-Forge 则使用语言生成基于体素的模型。
  • 点云Point-EPulsar+CLIP 利用语言生成 3D 点云。
  • 自动纹理Dream Textures 利用文本到图像的能力在 Blender 中自动为场景添加纹理。

为什么文本到 3D 仍未准备好用于游戏

在游戏开发中采用文本到 3D 的主要障碍是视图合成(NeRF)与现代游戏引擎使用的多边形网格之间的根本差异。

NeRF 到网格的流水线

目前正在进行将 NeRF 转换为网格的工作(例如 NVlabs instant-ngp),但该过程类似于摄影测量。它将对象的多个视图合成为 3D 资产,但生成的网格并不能立即在游戏引擎中使用。

手动后处理需求

通过文本到 NeRF 再到网格的流水线生成的资产需要大量专业知识和手动工作才能达到“可用于游戏”的状态。由于这些资产的精细化往往比从头创建低多边形资产耗时更多,它们目前不适合快速开发周期(例如在五天内完成一款游戏)。

3D AI 生成的未来方向

为弥合当前研究与实际游戏开发之间的差距,确定了两条主要路径:

  1. 增强型网格生成:改进 NeRF 到网格的转换以及直接网格生成,降低手动后处理需求,生成更易于集成到引擎中的资产。
  2. 引擎内直接渲染:开发新渲染技术,使 NeRF 能够直接在游戏引擎中渲染,可能完全省去网格转换的需求。

Sources