zju3dv/Diffuman4D
[ICCV 2025] Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models
What it solves
Diffuman4D 解決了從稀疏視角影片中進行高保真度、4D 一致性人類視角合成的挑戰。它允許用戶從任何視角(自由視角渲染)渲染人類表演,並在幀與幀之間保持時間一致性。
How it works
該項目利用時空擴散模型,從有限數量的輸入相機來生成一致的人類視角。系統可以從稀疏輸入生成 3D 圖像網格(單幀)或 4D 圖像網格(序列幀),然後可以使用這些生成的視角來重建高質量的 3D 或 4D 高斯潑濺(3DGS/4DGS)模型,以實現沉浸式渲染。
Who it’s for
研究人員和開發人員,特別是從事電腦視覺、以人為中心的三維/四維生成以及沉浸式媒體領域,且需要從有限的相機設置中合成人類表演的新視角的研究人員和開發人員。
Highlights
- Spatio-Temporal Diffusion: 使用擴散模型來確保在空間(不同視角)和時間(幀)上的兩者一致性。
- Sparse-to-Dense View Synthesis: 可以將稀疏視角影片(例如:4 個輸入相機)轉換為密集視角網格(例如:44 個相機)。
- Processed DNA-Rendering Dataset: 提供了一個經過精心重新標註的 DNA-Rendering 数据集,包含 1000+ 人類多視角影片序列,包括前景掩碼和骨架數據。
- 4DGS Integration: 支持從合成的視角中重建 4D 高斯潑濺(4DGS)模型的流程。