fudan-generative-vision/Hallo-Live

[ACM MM 2026] Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation

What it solves

Hallo-Live는 디지털 아바타에 대한 동기화된 오디오와 비디오를 실시간으로 생성하는 문제를 해결합니다. 기존 방법은 높은 지연 시간이나 음성 및 입 움직임 간의 동기화 부족으로 어려움을 겪는데, 이 프레임워크는 낮은 지연 시간과 높은 시각적 충실도로 텍스트 프롬프트에서 말하는 아바터를 스트리밍 생성할 수 있습니다.

How it works

시스템은 인과적 듀얼 스트림 Diffusion Transformer(DiT) 모델을 사용해 오디오와 비디오를 동시에 생성합니다. 두 단계로 동작합니다:

  1. ODE Initialization: 사전 학습된 듀얼 스트림 DiT를 크로스 모달 미래 확장 블록‑인과적 마스크(block‑causal mask)를 사용해 스트리밍 환경에 맞게 조정합니다.
  2. Self-Rollout & DMD: 모델은 오디오‑비디오 KV 캐시를 활용해 자동 회귀 방식으로 self‑rollout을 수행하고, 보상 가중치가 적용된 듀얼 스트림 Distribution Matching Distillation(DMD)으로 생성된 궤적을 최적화합니다.

지연 시간을 더욱 줄이기 위해 프레임워크는 병렬 VAE 디코딩을 지원합니다. Diffusion 모델과 VAE 디코더를 별도의 GPU에서 실행해 생성과 디코딩을 겹쳐 수행합니다.

Who it’s for

이 프로젝트는 실시간 인터랙티브 AI 아바타, 디지털 휴먼, 혹은 정확한 립싱크와 고품질 음성이 필요한 스트리밍 콘텐츠 생성 도구를 개발하는 연구자와 개발자를 위해 설계되었습니다.

Highlights

  • Real-time Performance: 두 대의 NVIDIA H200 GPU에서 20.38 FPS를 달성하고 지연 시간은 0.94초에 불과합니다.
  • Joint Generation: 단일 텍스트 프롬프트만으로 동기화된 비디오와 음성을 동시에 생성합니다.
  • Versatile Styles: 실사 인간, 3D 애니메이션, 손그림 애니 스타일 등 다양한 캐릭터 유형을 지원합니다.
  • Low-Latency Architecture: 인과 DiT와 KV 캐싱을 활용해 스트리밍 추론을 가능하게 합니다.