fudan-generative-vision/Hallo-Live

[ACM MM 2026] Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation

What it solves

Hallo-Live は、デジタルアバターの同期音声・映像をリアルタイムで生成するという課題に取り組みます。従来の手法は高レイテンシや音声と口の動きの同期が取れないことが多く、このフレームワークは低レイテンシかつ高いビジュアル忠実度でテキストプロンプトから話すアバターをストリーミング生成できます。

How it works

システムは因果的なデュアルストリーム Diffusion Transformer(DiT)モデルを用いて音声と映像を同時に生成します。主に以下の二段階で動作します:

  1. ODE Initialization:事前学習済みのデュアルストリーム DiT を、クロスモーダルな未来拡張ブロック因果マスク(block‑causal mask)を用いてストリーミング設定に適応させます。
  2. Self-Rollout & DMD:モデルは音声‑映像 KV キャッシュを利用して自己回帰的に自己ロールアウトを行い、報酬重み付けされたデュアルストリーム分布マッチング蒸留(Distribution Matching Distillation, DMD)で生成軌道を最適化します。

レイテンシ削減のため、フレームワークは並列 VAE デコードをサポートし、Diffusion モデルと VAE デコーダを別々の GPU で動かして生成とデコードを重ね合わせます。

Who it’s for

本プロジェクトは、リアルタイムインタラクティブ AI アバター、デジタルヒューマン、または高精度なリップシンクと高品質音声が必要なストリーミングコンテンツ生成ツールを開発する研究者や開発者向けです。

Highlights

  • Real-time Performance:2枚の NVIDIA H200 GPU で 20.38 FPS、レイテンシはわずか 0.94 秒を実現。
  • Joint Generation:単一テキストプロンプトから同期した映像と音声を同時に生成。
  • Versatile Styles:リアルな人間、3D アニメ、手描きアニメなど多様なキャラクタースタイルに対応。
  • Low-Latency Architecture:因果 DiT と KV キャッシュを活用し、ストリーミング推論を可能に。