zju3dv/neuralbody

Code for "Neural Body: Implicit Neural Representations with Structured Latent Codes for Novel View Synthesis of Dynamic Humans" CVPR 2021 best paper candidate

Neural Body – 動的人体のための暗黙的ニューラル表現

概要

  • マルチビュービデオから動く人体の連続的な3D表現を学習する研究用コードベースです。暗黙的ニューラルフィールド(3‑D座標を色や占有率にマッピングするニューラルネットワーク)と、ポーズ依存の形状をエンコードする 構造化された潜在コード を使用します。
  • 目標は 新規視点合成 です。キャリブレーションされた数台のカメラがあれば、学習中に見られなかったポーズであっても、任意の新しい視点から人物をレンダリングできます。

主な機能

  • 学習: 2つの公開データセットをサポート
    • ZJU‑MoCap – 単一の俳優が多くの動作を行うマルチビューキャプチャ。
    • People‑Snapshot – さまざまな人物の短いビデオコレクション。
  • 推論: 以下の機能をサポート
    • 単一フレームの新規視点レンダリング。
    • 固定または回転カメラからの動く人物のビデオレンダリング。
    • 任意のフレームでの身体メッシュの抽出。
  • 未知のポーズ(新しい動作への一般化)および 白背景レンダリング をサポート。
  • PyTorchの torch.distributed を介した分散学習と、すぐに使用可能なDockerイメージを提供。

はじめ方

  1. インストールINSTALL.md に従って手動でcondaセットアップを行うか、docker/ 内のDockerfileを使用してください(Zhaoyi Wan氏に感謝)。
  2. データダウンロード – READMEには、ZJU‑MoCapおよびPeople‑Snapshotデータセットを取得するためのスクリプトと、Google Driveでホストされている事前学習済みチェックポイントへのリンクがあります。
  3. サンプル実行 – リポジトリにはすぐに使えるシェルスクリプトが含まれています:
    • visualize.sh は、新規視点、ポーズ変化ビデオ、メッシュのレンダリング方法を示します。
    • train.sh および test.sh は、シングルGPUおよびマルチGPUでの学習/評価コマンドを示します。
  4. カスタムデータtools/custom フォルダで、独自のマルチビューキャプチャにパイプラインを適応させる方法を説明しています。

データセットとリソース

  • ZJU‑MoCap – SMPLパラメータ(EasyMocapでフィッティング)付きのマルチビューキャプチャ。リポジトリには、オリジナルセットと新しいSMPLフィッティングセットの両方が提供されています。
  • People‑Snapshot – 野外ビデオ。リポジトリには処理スクリプト (process_snapshot.py) とSMPLパラメータのビジュアライザーが含まれています。
  • Mobile‑Stage および SyntheticHuman++ データセットは2024年1月に発表されました(アクセスにはGoogleフォームへのリンクを使用)。

典型的なワークフロー

# 1. データの準備 (例: People‑Snapshot)
python tools/process_snapshot.py --input path/to/video

# 2. 学習 (シングルGPU)
python train_net.py --cfg_file configs/snapshot_exp/snapshot_f3c.yaml \
    exp_name female3c resume False

# 3. フレームの新規視点の可視化
python run.py --type visualize \
    --cfg_file configs/snapshot_exp/snapshot_f3c.yaml \
    exp_name female3c vis_novel_view True num_render_views 144

# 4. メッシュのレンダリング
python run.py --type visualize \
    --cfg_file configs/snapshot_exp/snapshot_f3c.yaml \
    exp_name female3c vis_mesh True

対象ユーザー

  • ニューラルレンダリング、人体形状/ポーズモデリング、または新規視点合成を研究している研究者。
  • スパースなマルチカメラ設定からフォトリアルなアバターを生成するためのベースラインを必要とする開発者。
  • ビデオからアニメーション可能な3‑Dメッシュを抽出することに関心がある方。

引用 このコードまたは事前学習済みモデルを使用する場合は、CVPR 2021およびTPAMI 2023の論文を引用してください(BibTeXはREADMEに記載されています)。


上記のすべての情報はリポジトリのREADMEから直接取得したものであり、外部の仮定は追加されていません。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト