PunithVT/ai-avatar-system

🎭 AI Avatar / digital human platform — upload a photo, clone a voice, talk to any face in real time with lip-sync video. Open-source, self-hosted. Claude · Whisper · Chatterbox · MuseTalk.

Summary

A production-ready platform for creating photorealistic AI avatars with real-time lip-sync, zero-shot voice cloning, and multi-LLM support.

What it solves

AvatarAI 提供一個可投入生產的平台,用於創建能夠即時對話的寫實 AI 虛擬形象。它透過結合唇形同步影片生成、語音克隆與 LLM 驅動的對話,彌合了靜態 AI 聊天與沉浸式數位人類之間的差距,成為一個可部署的單一 Web 服務。

How it works

系統使用串流管線以降低延遲。使用者說話時,音訊會先由 Whisper STT 處理,接著送至 LLM(例如 Claude、GPT-4o,或透過 Ollama 的本機模型)。產生的文字會被切分成句子,並同時由 TTS 引擎(Chatterbox)與唇形同步引擎(MuseTalk)平行處理。這些結果會以 WebSockets 傳送為影片片段,使虛擬形象能在 LLM 完成整段回覆前就開始說話。

Who it’s for

此平台針對希望推出多使用者 AI 虛擬形象服務的開發者與企業而設計。它同時支援完全本地部署以確保隱私,以及使用 AWS GPU 的高效能即時互動部署。

Highlights

  • Zero-shot voice cloning: 僅使用 10 秒的音訊樣本,即可在 23 種語言中克隆聲音。
  • Real-time lip-sync: 使用 MuseTalk V1.5,在相容的 GPU 上達到 30 FPS 的即時唇形同步。
  • Barge-in capability: 使用者可在虛擬形象回覆途中插話,系統會立即取消正在處理的回應。
  • Local-first option: 支援使用 Ollama、Whisper 以及本機儲存的 100% 本地運行模式。
  • Production-grade infra: 包含 JWT 認證、速率限制、PostgreSQL、Redis 以及用於 AWS 部署的 Terraform 腳本,具備生產級基礎設施。