fudan-generative-vision/Hallo-Live

[ACM MM 2026] Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation

What it solves

Hallo-Live 解決了即時為數位化身產生同步音訊與影像的挑戰。傳統方法常因高延遲或語音與唇形不同步而表現不佳;此框架能以低延遲與高視覺保真度,從文字提示即時串流產生說話化身。

How it works

系統使用因果雙流 Diffusion Transformer(DiT)模型同時產生音訊與影像。它分為兩個主要階段:

  1. ODE Initialization:將預訓練的雙流 DiT 透過跨模態未來擴展的區塊因果遮罩(block‑causal mask)調整為串流設定。
  2. Self-Rollout & DMD:模型利用音訊‑影像 KV 快取執行自回歸自展(self‑rollout),並以獎勵加權的雙流分佈匹配蒸餾(Distribution Matching Distillation, DMD)優化產生的軌跡。

為進一步降低延遲,框架支援平行 VAE 解碼,將 diffusion 模型與 VAE 解碼器分別部署在不同 GPU 上,以實現產生與解碼的重疊執行。

Who it’s for

此專案適合研究人員與開發者,打造即時互動式 AI 化身、數位人類,或需要精確唇形同步與高品質語音的串流內容生成工具。

Highlights

  • Real-time Performance:在兩張 NVIDIA H200 GPU 上達到 20.38 FPS,僅 0.94 秒延遲。
  • Joint Generation:僅用單一文字提示即可同時產生同步的影片與語音。
  • Versatile Styles:支援多種角色類型,包括寫實人類、3D 動畫、手繪動畫風格。
  • Low-Latency Architecture:利用因果 DiT 與 KV 快取實現串流推論。