PunithVT/ai-avatar-system
🎭 AI Avatar / digital human platform — upload a photo, clone a voice, talk to any face in real time with lip-sync video. Open-source, self-hosted. Claude · Whisper · Chatterbox · MuseTalk.
Summary
A production-ready platform for creating photorealistic AI avatars with real-time lip-sync, zero-shot voice cloning, and multi-LLM support.
What it solves
AvatarAI 提供一个可投入生产的平台,用于创建能够实时对话的写实 AI 虚拟形象。它通过结合唇形同步视频生成、语音克隆与 LLM 驱动的对话,弥合了静态 AI 聊天与沉浸式数字人类之间的差距,成为一个可部署的单一 Web 服务。
How it works
系统使用流式管线以降低延迟。用户说话时,音频会先由 Whisper STT 处理,接着送至 LLM(例如 Claude、GPT-4o,或通过 Ollama 的本机模型)。产生的文字会被切分成句子,并同时由 TTS 引擎(Chatterbox)与唇形同步引擎(MuseTalk)并行处理。这些结果会以 WebSockets 传送为视频片段,使虚拟形象能在 LLM 完成整段回复前就开始说话。
Who it’s for
此平台针对希望推出多用户 AI 虚拟形象服务的开发者与企业而设计。它同时支持完全本地部署以确保隐私,以及使用 AWS GPU 的高性能实时互动部署。
Highlights
- Zero-shot voice cloning: 仅使用 10 秒的音频样本,即可在 23 种语言中克隆声音。
- Real-time lip-sync: 使用 MuseTalk V1.5,在兼容的 GPU 上实现 30 FPS 的实时唇形同步。
- Barge-in capability: 用户可在虚拟形象回复途中插话,系统会立即取消正在处理的响应。
- Local-first option: 支持使用 Ollama、Whisper 与本地存储的 100% 本地运行模式。
- Production-grade infra: 包含 JWT 认证、速率限制、PostgreSQL、Redis 以及用于 AWS 部署的 Terraform 脚本,具备生产级基础设施。