GVCLab/PersonaLive
[CVPR 2026] PersonaLive! : Expressive Portrait Image Animation for Live Streaming
何を解決するか
PersonaLive はリアルタイムでストリーミング可能なポートレートアニメーション用に設計されています。1枚の人物の参照画像をドライブ動画でアニメーション化でき、ライブストリーミング用途に適した無限長のポートレートアニメーションの作成が可能になります。
動作方法
このプロジェクトは、ドライブ動画から参照画像への動きを変換するための複数のコンポーネントを統合した拡散フレームワークを使用しています。動きエンコーダー、ポーズガイド、時間的モジュールを活用し、滑らかで表現力豊かなアニメーションを実現します。リアルタイム性能を達成するため、ストリーミング生成戦略をサポートしており、TensorRT を使用することで推論速度を約2倍に加速できます。
対象ユーザー
このツールは、ポートレートアニメーション、デジタル人間、リアルタイム動画生成に興味を持つ学術研究者や開発者を主な対象としています。
主な特徴
- リアルタイムストリーミング: 低遅延で無限長のアニメーション生成が可能。
- ハードウェア最適化: TensorRT 加速と xFormers をサポートし、メモリ効率を向上。
- VRAM効率: 12GB VRAM のGPUでも長時間の動画生成が可能なストリーミング戦略を備えている。
- 包括的な学習パイプライン: 3段階の学習ワークフロー(画像レベルのウォームアップ、敵対的精緻化、時間的ファインチューニング)を提供。
- 統合: コミュニティプラグインを通じて ComfyUI に対応。
関連
- プロジェクト
Alibaba-Quark/LiveAvatarLive Avatar is a research‑grade system that turns spoken audio (plus an optional reference image or text prompt) into a continuous, real‑time video of a talking avatar. Built on a 14 B diffusion backbone (WanS2V‑14B) with a LoRA fine‑tune, the authors achieve ~45 FPS streaming on multi‑GPU H800 hardware and can generate videos longer than 10 000 seconds via block‑wise autoregressive processing. The repo provides Conda‑based installation, multi‑GPU and single‑GPU inference scripts, optional FP8 quantisation and JIT compilation for speed, and a Gradio UI. Model weights are hosted on Hugging Face under Apache 2.0.
- プロジェクト
jdh-algo/JoyVASAJoyVASA は diffusion ベースのフレームワークで、音声を用いて人間や動物のポートレートをアニメーション化し、顔のアイデンティティと動きを分離して高品質かつ長尺の動画生成を可能にします。
- プロジェクト
- プロジェクト
- プロジェクト
daydreamlive/scope自己回帰型拡散モデルとコンポーザブルアーキテクチャを用いた、リアルタイムでインタラクティブな生成AIビデオパイプラインを実行・カスタマイズするためのツール。