kocasariumut/FaceAnything
Official Implementation for "Face Anything: 4D Face Reconstruction from Any Image Sequence" (ECCV 2026, Oral (Spotlight))
What it is
Face Anything 是一個研究級的前饋神經模型,能將任何臉部圖像集合(照片連拍、影片或甚至是單張照片)轉換為時間一致的 4D 重建——一個隨時間移動的 3D 幾何結構,並帶有密集的逐像素對應關係。核心概念是標準人臉點預測:每個像素都被映射到共享標準人臉空間中的正規化座標,將追蹤和重建轉換為單一的密集映射問題。
What you get out of it
在輸入序列上執行提供的 run_inference.py 會產生一系列視覺化產物:
- 彩色點雲影片(環繞相機)顯示重建的人臉。
- 追蹤影片,其中每個點在幀間保持一致的顏色,視覺化密集對應關係。
- 標準顏色渲染圖,根據其標準座標為每個點著色。
- 深度、法線和原始圖影片,用於分析或下游任務使用。
- 一個「大巡禮」影片,平滑地在所有模態之間轉換。
- 逐幀 PLY files(幾何、標準圖、追蹤)和相機內參/外參 (
cameras.npz/json)。 - 一個
raw_predictions.npz檔案,包含模型的原始輸出(深度、姿勢、標準圖、置信度、有效性遮罩)。
所有這些都會自動寫入輸出資料夾;您可以使用 --outputs 旗標來選擇子集。
How to get it running
- Clone the repo 並執行提供的
install.sh。該腳本會建立一個 Conda 環境,安裝 PyTorch 2.9 (CUDA 12.8) 和其他 Python 依賴項,並下載約 15 GB 的模型權重。 - GPU requirement – 模型需要 CUDA 支援的 GPU;目前僅在 Python 3.11 上進行過測試。
- Checkpoint – 腳本會從 Google Drive 或 Hugging-Face repo 取得
checkpoint.pt。您也可以手動將檔案放置在checkpoints/下。 - Run inference 使用單一命令:
python run_inference.py --input <path> --output <out_dir><path>可以是單張圖像、圖像資料夾或影片檔案。 n5. Optional flags 讓您控制解析度、處理模式 (all-at-oncevsone-by-one)、背景移除(透過 Robust Video Matting)、要生成的輸出物、環繞風格等。
When you'd want to use it
- Research 關於 4D 人臉動態、表情轉移或動畫製作,其中需要密集且時間一致的幾何結構。
- Content creation 遊戲或 AR/VR 領域,其中需要將隨意的影片片段轉換為 3D 人臉模型,且需要快速且即時的流程。
- Dataset generation – 作者們發布了針對精選的 “FaceAnything NeRSemble” 資料集提供的標準圖(可透過申請表單取得)。
Limitations & practical notes
- 模型是**前饋式(feed-forward)**的;它不進行迭代式精煉,因此與多視角 SfM 流程相比,可能缺失極高頻率的細節。
- Memory vs detail trade-off:
all-at-once提供更平滑的時間一致性,但表面較粗糙;one-by-one產生更精細的幾何結構,但以犧牲一致性與更高的 GPU 記憶體使用量為代價。 - 許可證是 CC-BY-NC 4.0,因此未經許可禁止商業用途。
Citation
@article{kocasari2026face,
title={Face Anything: 4D Face Reconstruction from Any Image Sequence},
author={Kocasari, Umut and Giebenhain, Simon and Shaw, Richard and Nießner, Matthias},
journal={arXiv preprint arXiv:2604.19702},
year={2026}
}
相關
- 專案
- 專案
- 專案
- 專案