zju3dv/Diffuman4D
[ICCV 2025] Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models
What it solves
Diffuman4D 解决了从稀疏视图的视频中进行高保真度、4D 一致性人体视图合成的挑战。它允许用户从任何视角(自由视角渲染)渲染人体表演,并保持帧间的时空一致性。
How it works
该项目利用空时扩散模型,从有限数量的输入相机,生成一致的人体视图。系统可以从稀疏输入生成 3D 图像网格(单帧)或 4D 图像网格(帧序列),然后可以使用这些生成的视图来重建高质量的 3D 或 4D 高斯泼溅(3DGS/4DGS)模型,以实现沉浸式渲染。
Who it’s for
从事计算机视觉、以人为中心的三维/四维生成以及沉浸式媒体的研究人员和开发人员,他们需要从有限的相机设置中合成人体表演的新视角。
Highlights
- Spatio-Temporal Diffusion: 使用扩散模型来确保空间(不同视图)和时间(帧)的一致性。
- Sparse-to-Dense View Synthesis: 可以将稀疏视图的视频(例如:4 个输入相机)转换为密集视图网格(例如:44 个相机)。
- Processed DNA-Rendering Dataset: 提供了一个经过精心重新标注的 DNA-Rendering 数据集,包含 1000+ 人体多视图视频序列,包括前景掩码和骨架数据。
- 4DGS Integration: Supports workflows for reconstructing 4D Gaussian Splatting models from the synthesized views.