PunithVT/ai-avatar-system

🎭 AI Avatar / digital human platform — upload a photo, clone a voice, talk to any face in real time with lip-sync video. Open-source, self-hosted. Claude · Whisper · Chatterbox · MuseTalk.

解决的问题

AvatarAI 提供一个生产就绪的平台,用于创建可进行实时对话的写实AI虚拟形象。它通过将语音转文本(STT)、大语言模型(LLM)、语音克隆和唇形同步视频生成整合到一个低延迟的流水线中,消除了静态AI聊天与沉浸式数字人之间的差距。

工作原理

该系统使用流式处理管道以最小化延迟。当用户说话时,Whisper STT 将音频转换为文本,然后发送给 LLM(Claude、GPT-4o 或通过 Ollama 使用本地模型)。生成的文本被拆分为句子,并行处理:每个句子通过 Chatterbox TTS(支持零样本语音克隆)转换为语音,然后使用 MuseTalk V1.5 引擎进行动画处理,生成唇形同步视频片段。这些片段通过 WebSockets 流式传输到浏览器,使得虚拟形象在 LLM 完成全部响应之前即可开始说话。

适用人群

专为希望部署多用户Web服务以实现数字人交互的开发者和企业设计,而非仅用于研究演示。适合希望100%本地运行以保障隐私,或在 AWS GPU 实例上部署以实现高性能实时交互的用户。

主要亮点

  • 实时唇形同步:使用 MuseTalk V1.5,在 GPU 上实现高达 30 FPS。
  • 零样本语音克隆:仅需 10 秒音频样本,即可在 23 种不同语言中克隆语音。
  • 打断功能(Barge-In):允许用户在虚拟形象回复过程中打断,实现更自然的对话。
  • 多 LLM 支持:兼容 Claude、GPT-4o 以及本地引擎如 Ollama、vLLM 或 LM Studio。
  • 生产级基础设施:包含 JWT 认证、速率限制、PostgreSQL 数据库,以及用于部署的 AWS Terraform 脚本。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目