kocasariumut/FaceAnything

Official Implementation for "Face Anything: 4D Face Reconstruction from Any Image Sequence" (ECCV 2026, Oral (Spotlight))

What it is

Face Anything 是一個研究級的前饋神經模型,能將任何臉部圖像集合(照片連拍、影片或甚至是單張照片)轉換為時間一致的 4D 重建——一個隨時間移動的 3D 幾何結構,並帶有密集的逐像素對應關係。核心概念是標準人臉點預測:每個像素都被映射到共享標準人臉空間中的正規化座標,將追蹤和重建轉換為單一的密集映射問題。

What you get out of it

在輸入序列上執行提供的 run_inference.py 會產生一系列視覺化產物:

  • 彩色點雲影片(環繞相機)顯示重建的人臉。
  • 追蹤影片,其中每個點在幀間保持一致的顏色,視覺化密集對應關係。
  • 標準顏色渲染圖,根據其標準座標為每個點著色。
  • 深度、法線和原始圖影片,用於分析或下游任務使用。
  • 一個「大巡禮」影片,平滑地在所有模態之間轉換。
  • 逐幀 PLY files(幾何、標準圖、追蹤)和相機內參/外參 (cameras.npz/json)。
  • 一個 raw_predictions.npz 檔案,包含模型的原始輸出(深度、姿勢、標準圖、置信度、有效性遮罩)。

所有這些都會自動寫入輸出資料夾;您可以使用 --outputs 旗標來選擇子集。

How to get it running

  1. Clone the repo 並執行提供的 install.sh。該腳本會建立一個 Conda 環境,安裝 PyTorch 2.9 (CUDA 12.8) 和其他 Python 依賴項,並下載約 15 GB 的模型權重。
  2. GPU requirement – 模型需要 CUDA 支援的 GPU;目前僅在 Python 3.11 上進行過測試。
  3. Checkpoint – 腳本會從 Google Drive 或 Hugging-Face repo 取得 checkpoint.pt。您也可以手動將檔案放置在 checkpoints/ 下。
  4. Run inference 使用單一命令:
    python run_inference.py --input <path> --output <out_dir>
    
    <path> 可以是單張圖像、圖像資料夾或影片檔案。 n5. Optional flags 讓您控制解析度、處理模式 (all-at-once vs one-by-one)、背景移除(透過 Robust Video Matting)、要生成的輸出物、環繞風格等。

When you'd want to use it

  • Research 關於 4D 人臉動態、表情轉移或動畫製作,其中需要密集且時間一致的幾何結構。
  • Content creation 遊戲或 AR/VR 領域,其中需要將隨意的影片片段轉換為 3D 人臉模型,且需要快速且即時的流程。
  • Dataset generation – 作者們發布了針對精選的 “FaceAnything NeRSemble” 資料集提供的標準圖(可透過申請表單取得)。

Limitations & practical notes

  • 模型是**前饋式(feed-forward)**的;它不進行迭代式精煉,因此與多視角 SfM 流程相比,可能缺失極高頻率的細節。
  • Memory vs detail trade-off: all-at-once 提供更平滑的時間一致性,但表面較粗糙;one-by-one 產生更精細的幾何結構,但以犧牲一致性與更高的 GPU 記憶體使用量為代價。
  • 許可證是 CC-BY-NC 4.0,因此未經許可禁止商業用途。

Citation

@article{kocasari2026face,
  title={Face Anything: 4D Face Reconstruction from Any Image Sequence},
  author={Kocasari, Umut and Giebenhain, Simon and Shaw, Richard and Nießner, Matthias},
  journal={arXiv preprint arXiv:2604.19702},
  year={2026}
}

相關

  • 專案
  • 專案
  • 專案
  • 專案