anliyuan/Ultralight-Digital-Human

一个超轻量级、可以在移动端实时运行的数字人模型

何を解決するか

このプロジェクトは、モバイルデバイス上でリアルタイムで動作可能な軽量なデジタル人間モデルを提供します。特定の人物の短い動画(3〜5分)から、音声トラックに同期した口元の動きを再現するパーソナライズされたトークヘッドアバターを作成できます。

動作方法

システムは、各個人用に専用モデルをトレーニングするパーソナライズドアプローチを使用しています。音声は、高品質なHuBERTや、高速でモバイル対応のWenetなどのエンコーダーで処理されます。その後、UNetベースのアーキテクチャが音声特徴を視覚的な顔の動きにマッピングします。プロジェクトは遅延を低減するためのストリーミング推論をサポートしており、ONNXエクスポートによりモバイルハードウェアでのパフォーマンスを最適化できます。

対象ユーザー

  • モバイルアプリ用のリアルタイムAIアバターを開発する開発者。
  • 最小限のトレーニングデータでパーソナライズされたデジタルダブルを作成したいユーザー。
  • 軽量でオンデバイスでのトークヘッド生成に興味を持つ研究者。

特徴

  • モバイルリアルタイムパフォーマンス:モバイルデバイス上で効率的に動作するように設計されています。
  • 柔軟な音声エンコーダー:品質重視のHuBERTと速度重視のWenetの両方をサポートします。
  • ストリーミング対応:低遅延再生を実現するためのストリーミング推論ロジックを含みます。
  • パーソナライズドトレーニング:数分間の映像データからカスタムモデルを簡単にトレーニングするためのパイプラインを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト