PunithVT/ai-avatar-system

🎭 AI Avatar / digital human platform — upload a photo, clone a voice, talk to any face in real time with lip-sync video. Open-source, self-hosted. Claude · Whisper · Chatterbox · MuseTalk.

何を解決するか

AvatarAIは、リアルタイム会話が可能な写実的なAIアバターを作成するための本番環境対応プラットフォームを提供します。静的なAIチャットと没入型のデジタル人間の間のギャップを解消するために、音声認識(STT)、LLM、音声クローン、リップシンク動画生成を1つの低遅延パイプラインに統合しています。

動作方法

システムはストリーミングパイプラインを使用して遅延を最小限に抑えます。ユーザーが話すと、Whisper STTが音声をテキストに変換し、LLM(Claude、GPT-4o、またはOllama経由のローカルモデル)に送信されます。得られたテキストは文に分割され、並列処理されます。各文はChatterbox TTS(ゼロショット音声クローンをサポート)で音声に変換され、MuseTalk V1.5エンジンでアニメーション化され、リップシンク動画のチャンクが生成されます。これらのチャンクはWebSockets経由でブラウザにストリーミングされ、LLMが完全な応答を生成する前にアバターが話し始めることができます。

対象ユーザー

研究デモではなく、マルチユーザーWebサービスとしてデジタル人間を展開したい開発者や企業向けに設計されています。プライバシーを重視してシステムを100%ローカルで実行したい人、またはAWS GPUインスタンスにデプロイして高パフォーマンスなリアルタイム対話を行いたい人におすすめです。

特徴

  • リアルタイムリップシンク:GPU上で最大30 FPSを実現するMuseTalk V1.5を使用。
  • ゼロショット音声クローン:10秒の音声サンプルから23の異なる言語で音声をクローン可能。
  • バージイン機能:アバターの返答途中でユーザーが中断できるため、より自然な会話が可能。
  • マルチLLM対応:Claude、GPT-4o、およびOllama、vLLM、LM Studioなどのローカルエンジンと互換性あり。
  • 本番環境対応インフラ:JWT認証、レート制限、PostgreSQLデータベース、AWS Terraformスクリプトによるデプロイを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト