ゲーム開発向け Hugging Face AI:3D アセット生成
TL;DR
テキストから 3D への AI は、生成された出力が「ゲーム対応」ではないため、現在のところゲーム開発ワークフローで即座に使用するには実用的ではありません。いくつかの研究モデルは 3D 表現を生成できますが、通常、使用可能なゲームメッシュに変換するために大幅な手動の後処理が必要です。
テキストから 3D への現状
テキストから画像へのツールがゲーム開発に高度に統合されている一方で、テキストから 3D への技術はまだ初期段階です。テキスト記述から 3D アセットを生成するために、現在さまざまな技術的アプローチが検討されています:
- View Synthesis and NeRFs: DreamFusion のようなツールは 2D ディフュージョンを使用して 3D アセットを生成し、CLIP-NeRF はテキストと画像でニューラル放射場 (NeRF) を駆動します。現在の多くのアプローチは、従来の 3D レンダリングではなく、対象の新しい視点を生成するビュー合成に依存しています。
- Direct Mesh and Voxel Generation: CLIPMatrix と CLIP-Mesh-SMPLX はテクスチャ付きメッシュを直接生成し、CLIP-Forge は言語を用いてボクセルベースのモデルを生成します。
- Point Clouds: Point-E と Pulsar+CLIP は言語を利用して 3D ポイントクラウドを生成します。
- Automated Texturing: Dream Textures はテキストから画像への機能を活用し、Blender 内のシーンに自動的にテクスチャを付与します。
なぜテキストから 3D がまだゲーム対応でないのか
ゲーム開発でテキストから 3D を採用する際の主な障壁は、ビュー合成(NeRF)と現代のゲームエンジンが使用するポリゴンメッシュとの根本的な違いです。
NeRF からメッシュへのパイプライン
NeRF をメッシュに変換する取り組み(例:NVlabs instant-ngp)が進行中ですが、このプロセスはフォトグラメトリに似ています。オブジェクトの複数の視点を組み合わせて 3D アセットを作成しますが、生成されたメッシュはゲームエンジンで直ちに使用できるものではありません。
手動の後処理要件
テキスト → NeRF → メッシュ パイプラインで生成されたアセットは、「ゲーム対応」になるために高度な専門知識と手作業が大幅に必要です。これらのアセットは、ゼロから低ポリゴンアセットを作成するよりも精緻化に時間がかかることが多く、現在のところ(例:5 日でゲームを作る)ような迅速な開発サイクルには適していません。
3D AI 生成の今後の方向性
現在の研究と実用的なゲーム開発のギャップを埋めるために、主に 2 つの方向性が挙げられます:
- Enhanced Mesh Generation: NeRF からメッシュへの変換や直接メッシュ生成の改善により、手動後処理の必要性を減らし、エンジンへの統合が容易なアセットを生成します。
- Direct In-Engine Rendering: 新しいレンダリング技術の開発により、NeRF をゲームエンジン内で直接レンダリングできるようにし、メッシュ変換の必要性を完全に回避できる可能性があります。