zju3dv/Diffuman4D

[ICCV 2025] Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models

What it solves

Diffuman4Dは、疎な視点からのビデオから高忠実度で4D一貫性のある人間視点合成を行うという課題を課題として解決します。ユーザーは、フレーム間の時間的一貫性を保ちながら、任意の視点(自由視点レンダリング)から人間のパフォーマンスをレンダリングすることができます。

How it works

このプロジェクトは、時空拡散モデルを利用して、限られた数の入力カメラから一貫性のある人間の視点を作成します。システムは、疎な入力から 3D 画像グリッド(単一フレーム)または 4D 画像グリッド(フレームシーケンス)を生成します。これらの生成された視点は、没入型レンダリングのための高品質な 3D または 4D Gaussian Splatting (3DGS/4DGS) モデルを再構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成構成

Who it’s for

コンピュータビジョン、人間中心の 3D/4D 生成、および没入型メディアの研究者や開発者で、限られたカメラセットアップから人間のパフォーマンスの新しい視点を作成する必要がある人々。

Highlights

  • Spatio-Temporal Diffusion: 拡散モデルを使用して、空間(異なる視点)と時間(フレーム)の両方で一貫性を確保します。
  • Sparse-to-Dense View Synthesis: 疎な視点からのビデオ(例:4つの入力カメラ)を、密な視点グリッド(例:44つのカメラ)に変換できます。
  • Processed DNA-Rendering Dataset: 細かく再アノテーションされた DNA-Rendering データセットを提供します。1000以上の人間マルチビュービデオシーケンス(前景マスクとスケルトンデータを含む)が含まれています。
  • 4DGS Integration: 生成された視点から 4D Gaussian Splatting モデルを再構成するためのワークフローをサポートします。