kocasariumut/FaceAnything

Official Implementation for "Face Anything: 4D Face Reconstruction from Any Image Sequence" (ECCV 2026, Oral (Spotlight))

What it is

Face Anythingは、研究グレードのフィードフォワード・ニューラルモデルであり、顔の画像集合(写真のバースト、ビデオ、または単一の写真)を時間的に一貫性のある4D再構成——3D幾何学構造が時間とともに動き、高密度なピクセルごとの対応関係を持つもの——に変換します。核心となるアイデアはcanonical facial point predictionです。すべてのピクセルを共有の標準的な顔の空間における正規化された座標にマッピングすることで、トラッキングと再構成を単一の高密度マッピング問題へと集約します。

What you get out of it

提供された run_inference.py を入力シーケンスに対して実行すると、一連の視覚的成果物が出力されます:

  • 彩色された点群ビデオ(オービットカメラ)で、再構成された顔を表示します。

  • Track videos:各ポイントがフレーム間で一貫した色を保持し、高密度な対応関係を可視化します。

  • Canonical-coloured renders:各ポイントを標準座標に基づいて色付けされたレンダリングです。

  • Depth, normal and raw map videos:分析やダウンストリームタスクのための深度、法線、および生データマップのビデオです。

  • A “grand tour” ビデオ:すべてのモダリティをスムーズにモーフィング・スルーするビデオです。

  • Per-frame PLY files:フレームごとのPLYメッシュ(幾何学、標準マップ、トラック)およびカメラの内部パラメータ/外部パラメータ (cameras.npz/json)。

  • A raw_predictions.npz ファイル:モデルの生出力(深度、ポーズ、標準座標マップ、信頼度、有効性マスク)を含むファイルです。

How to get it running

  1. Clone the repo し、提供された install.sh を実行します。このスクリプトは、Conda環境を作成し、PyTorch 2.9 (CUDA 12.8) とその他の Python 依存関係をインストールし、約 15 GB のモデルチェックポイントをダウンロードします。
  2. GPU requirement – モデルはCUDA対応のGPUが必要です。Python 3.11 でのみテスト済みです。
  3. Checkpoint – ス脚本は Google Drive または Hugging-Face repo から checkpoint.pt を取得します。手動で checkpoints/ にファイルを配置することも可能です。
  4. Run inference を単一のコマンドで実行します:
    python run_inference.py --input <path> --output <out_dir>
    
    <path> は、単一の画像、画像フォルダ、またはビデオファイルです。
  5. Optional flags により、解像度、処理モード (all-at-once vs one-by-one)、背景除去(Robust Video Matting を使用)などの設定が可能です。

When you'd want to use it

  • Research:4D顔のダイナミクス、表情の転送、または高密度で時間的に一貫性のある幾何学構造が必要なアニメーション研究。
  • Content creation:ゲームや AR/VR 領域において、カジュアルな映像素材から 3D 顔モデルを素早く構築するパイプラインが有用な場合。
  • Dataset generation – 作者らは、精選された “FaceAnything NeRSemble” データセット用の標準マップを公開しています(リクエストフォーム経由でアクセス可能)。

Limitations & practical notes

  • モデルはフィードフォワードのみです。反復的な精緻化は行わないため、マルチビュー SfM パイプラインと比較して、極めて高周波な詳細が欠落する可能性があります。
  • Memory vs detail trade-offall-at-once はより滑らかな時間的一貫性を提供しますが、表面は粗くなります。one-by-one は、一貫性や GPU メモリの使用量との引き換えに、より精細な幾何学構造を結果として得られます。
  • ライセンスは CC-BY-NC 4.0 です。許可なしに商業利用することは禁止されています。

Citation

@article{kocasari2026face,
  title={Face Anything: 4D Face Reconstruction from Any Image Sequence},
  author={Kocasari, Umut and Giebenhain, Simon and Shaw, Richard and Nießner, Matthias},
  journal={arXiv preprint arXiv:2604.19702},
  year={2026}
}

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト