fudan-generative-vision/Hallo-Live

[ACM MM 2026] Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation

What it solves

Hallo-Live 解决了实时为数字化身生成同步音频和视频的挑战。传统方法常因高延迟或语音与唇形不同步而表现不佳;此框架能够以低延迟和高视觉保真度,从文本提示实时流式生成说话化身。

How it works

系统使用因果双流 Diffusion Transformer(DiT)模型同时生成音频和视频。它分为两个主要阶段:

  1. ODE Initialization:将预训练的双流 DiT 通过跨模态未来扩展的块因果掩码(block‑causal mask)适配为流式设置。
  2. Self-Rollout & DMD:模型利用音频‑视频 KV 缓存执行自回归自展开(self‑rollout),并以奖励加权的双流分布匹配蒸馏(Distribution Matching Distillation, DMD)优化生成的轨迹。

为进一步降低延迟,框架支持并行 VAE 解码,将 diffusion 模型和 VAE 解码器分别运行在不同 GPU 上,以实现生成与解码的重叠执行。

Who it’s for

该项目面向研究人员和开发者,构建实时交互式 AI 化身、数字人类,或需要精确唇形同步和高质量语音的流媒体内容生成工具。

Highlights

  • Real-time Performance:在两块 NVIDIA H200 GPU 上实现 20.38 FPS,仅 0.94 秒延迟。
  • Joint Generation:仅用单一文本提示即可同步生成视频和语音。
  • Versatile Styles:支持多种角色类型,包括写实人类、3D 动漫和手绘动漫风格。
  • Low-Latency Architecture:利用因果 DiT 与 KV 缓存实现流式推理。