OpenAI Point-E:从文本提示生成 3D 点云
OpenAI 推出了 Point-E,这是一套旨在根据复杂文本提示生成 3D 点云的系统。通过使用两阶段扩散过程,Point-E 将生成 3D 模型所需的时间从数小时的 GPU 计算降低到单个 GPU 上的 1-2 分钟。
高速 3D 生成流水线
Point-E 通过将 3D 对象创建过程拆分为两个独立的扩散阶段,实现了快速的生成速度:
- Text-to-Image Diffusion:系统首先使用文本到图像的扩散模型生成对象的单个合成视图。
- Image-to-Point Cloud Diffusion:第二个扩散模型随后以生成的图像为条件,生成最终的 3D 点云。
该架构使得 Point-E 的采样速度比之前的最先进文本条件 3D 对象生成方法快一到两个数量级。
性能权衡与能力
虽然 Point-E 优先考虑速度,但在输出质量上存在权衡。OpenAI 指出,该方法在样本质量方面仍未达到最先进水平。然而,生成时间的大幅缩短使其在需要快速原型或快速迭代的使用场景中成为实用选择。
可用性与开源
OpenAI 已通过 GitHub 向公众发布了预训练的点云扩散模型以及相关的评估代码和模型。