GVCLab/PersonaLive
[CVPR 2026] PersonaLive! : Expressive Portrait Image Animation for Live Streaming
해결하는 문제
PersonaLive는 실시간 스트리밍 가능한 포트레이트 애니메이션을 위해 설계되었습니다. 한 명의 사람에 대한 참조 이미지를 드라이빙 비디오로 애니메이션화할 수 있어, 라이브 스트리밍 애플리케이션에 적합한 무한 길이의 포트레이트 애니메이션을 생성할 수 있습니다.
작동 방식
이 프로젝트는 드라이빙 비디오의 움직임을 참조 이미지로 변환하기 위해 여러 구성 요소를 통합한 확산 프레임워크를 사용합니다. 움직임 인코더, 포즈 가이드, 시간 모듈을 활용하여 부드럽고 표현력 있는 애니메이션을 보장합니다. 실시간 성능을 달성하기 위해 스트리밍 생성 전략을 지원하며, TensorRT를 사용하면 추론 속도를 약 2배로 가속화할 수 있습니다.
대상 사용자
이 도구는 포트레이트 애니메이션, 디지털 인간, 실시간 비디오 생성에 관심이 있는 학계 연구자 및 개발자에게 주로 적합합니다.
주요 특징
- 실시간 스트리밍: 낮은 지연으로 무한 길이의 애니메이션 생성 가능.
- 하드웨어 최적화: TensorRT 가속 및 xFormers를 지원하여 메모리 효율성 향상.
- VRAM 효율성: 12GB VRAM이 있는 GPU에서도 긴 비디오 생성이 가능한 스트리밍 전략 포함.
- 포괄적인 학습 파이프라인: 이미지 수준 워밍업, 적대적 정교화, 시간적 미세 조정의 3단계 학습 워크플로 제공.
- 통합: 커뮤니티 플러그인을 통해 ComfyUI와 호환.
관련
- 프로젝트
Alibaba-Quark/LiveAvatarLive Avatar is a research‑grade system that turns spoken audio (plus an optional reference image or text prompt) into a continuous, real‑time video of a talking avatar. Built on a 14 B diffusion backbone (WanS2V‑14B) with a LoRA fine‑tune, the authors achieve ~45 FPS streaming on multi‑GPU H800 hardware and can generate videos longer than 10 000 seconds via block‑wise autoregressive processing. The repo provides Conda‑based installation, multi‑GPU and single‑GPU inference scripts, optional FP8 quantisation and JIT compilation for speed, and a Gradio UI. Model weights are hosted on Hugging Face under Apache 2.0.
- 프로젝트
jdh-algo/JoyVASAJoyVASA는 diffusion 기반 프레임워크로, 오디오를 사용해 인간 및 동물 초상화를 애니메이션화하며 얼굴 정체성과 움직임을 분리해 고품질·장시간 비디오 생성을 가능하게 합니다.
- 프로젝트
- 프로젝트
- 프로젝트
daydreamlive/scope자기회귀 확산 모델과 구성 가능한 아키텍처를 사용하여 실시간으로 상호작용 가능한 생성형 AI 비디오 파이프라인을 실행하고 사용자 정의할 수 있는 도구입니다.