PunithVT/ai-avatar-system

🎭 AI Avatar / digital human platform — upload a photo, clone a voice, talk to any face in real time with lip-sync video. Open-source, self-hosted. Claude · Whisper · Chatterbox · MuseTalk.

解決的問題

AvatarAI 提供一個生產就緒的平台,用於建立可進行即時對話的寫實 AI 虛擬形象。它透過將語音轉文字(STT)、大語言模型(LLM)、語音克隆與唇形同步影片生成整合至單一低延遲的流程中,消弭了靜態 AI 聊天與沉浸式數位人之間的差距。

工作原理

該系統使用串流處理流程以最小化延遲。當使用者說話時,Whisper STT 將音訊轉換為文字,再傳送給 LLM(Claude、GPT-4o 或透過 Ollama 使用本地模型)。產生的文字被拆分成句子,並行處理:每個句子透過 Chatterbox TTS(支援零樣本語音克隆)轉換為語音,再使用 MuseTalk V1.5 引擎進行動畫處理,生成唇形同步影片片段。這些片段透過 WebSockets 流式傳送到瀏覽器,使虛擬形象在 LLM 完成全部回應前即可開始說話。

適用對象

專為希望部署多使用者 Web 服務以實現數位人互動的開發者與企業設計,而非僅用於研究示範。適合希望 100% 本地運行以保障隱私,或在 AWS GPU 實例上部署以實現高性能量產即時互動的使用者。

主要亮點

  • 即時唇形同步:使用 MuseTalk V1.5,在 GPU 上實現最高 30 FPS。
  • 零樣本語音克隆:僅需 10 秒音訊樣本,即可在 23 種不同語言中克隆語音。
  • 中斷功能(Barge-In):允許使用者在虛擬形象回應過程中中斷,實現更自然的對話。
  • 多 LLM 支援:相容 Claude、GPT-4o 以及本地引擎如 Ollama、vLLM 或 LM Studio。
  • 生產級基礎設施:包含 JWT 認證、速率限制、PostgreSQL 資料庫,以及用於部署的 AWS Terraform 腳本。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案