PunithVT/ai-avatar-system
🎭 AI Avatar / digital human platform — upload a photo, clone a voice, talk to any face in real time with lip-sync video. Open-source, self-hosted. Claude · Whisper · Chatterbox · MuseTalk.
Summary
A production-ready platform for creating photorealistic AI avatars with real-time lip-sync, zero-shot voice cloning, and multi-LLM support.
What it solves
AvatarAI は、リアルタイム会話が可能なフォトリアリスティックな AI アバターを作成するための、プロダクションレディなプラットフォームを提供します。リップシンク動画生成、音声クローン、LLM 駆動の対話を組み合わせることで、静的な AI チャットと没入型デジタルヒューマンのギャップを埋め、単一のデプロイ可能な Web サービスとして実現します。
How it works
システムはストリーミングパイプラインを使用してレイテンシを最小化します。ユーザーが話すと、音声は Whisper STT で処理され、LLM(Claude、GPT-4o、または Ollama 経由のローカルモデルなど)へ送られます。生成されたテキストは文に分割され、TTS エンジン(Chatterbox)とリップシンクエンジン(MuseTalk)で並列に処理されます。これらは WebSockets を介してビデオチャンクとして配信され、LLM が全体の応答を完了する前にアバターが話し始めることができます。
Who it’s for
マルチユーザー AI アバターサービスを提供したい開発者や企業向けに設計されています。プライバシー保護のための完全ローカル展開と、高性能・リアルタイムインタラクションのための AWS GPU 展開の両方をサポートします。
Highlights
- Zero-shot voice cloning: 10 秒の音声サンプルだけで、23 言語にわたる音声をクローンできます。
- Real-time lip-sync: MuseTalk V1.5 を使用し、対応 GPU で 30 FPS を実現します。
- Barge-in capability: ユーザーはアバターの応答途中で割り込むことができ、システムは飛行中の応答を即座にキャンセルします。
- Local-first option: Ollama、Whisper、ローカルストレージを使用した 100% ローカル運用をサポートします。
- Production-grade infra: JWT 認証、レートリミット、PostgreSQL、Redis、AWS デプロイ用 Terraform スクリプトを含む、プロダクションレベルのインフラを提供します。