PunithVT/ai-avatar-system

🎭 AI Avatar / digital human platform — upload a photo, clone a voice, talk to any face in real time with lip-sync video. Open-source, self-hosted. Claude · Whisper · Chatterbox · MuseTalk.

Summary

A production-ready platform for creating photorealistic AI avatars with real-time lip-sync, zero-shot voice cloning, and multi-LLM support.

What it solves

AvatarAI는 실시간 대화가 가능한 포토리얼리스틱 AI 아바타를 만들기 위한 프로덕션 레디 플랫폼을 제공합니다. 립싱크 비디오 생성, 음성 클로닝, LLM 기반 대화를 결합하여 정적인 AI 채팅과 몰입형 디지털 휴먼 사이의 격차를 해소하고, 단일 배포 가능한 웹 서비스로 구현합니다.

How it works

시스템은 스트리밍 파이프라인을 사용해 지연 시간을 최소화합니다. 사용자가 말을 하면 오디오가 Whisper STT로 처리된 뒤 LLM(Claude, GPT-4o 또는 Ollama를 통한 로컬 모델 등)으로 전송됩니다. 생성된 텍스트는 문장 단위로 나뉘어 TTS 엔진(Chatterbox)과 립싱크 엔진(MuseTalk)에서 병렬로 처리됩니다. 이 결과는 WebSockets를 통해 비디오 청크로 전달되어 LLM이 전체 응답을 마치기 전에 아바타가 말을 시작할 수 있습니다.

Who it’s for

다중 사용자 AI 아바타 서비스를 제공하려는 개발자와 기업을 위해 설계되었습니다. 프라이버시를 위한 완전 로컬 배포와 고성능 실시간 인터랙션을 위한 AWS GPU 배포를 모두 지원합니다.

Highlights

  • Zero-shot voice cloning: 10초 오디오 샘플만으로 23개 언어에 걸쳐 음성을 클론합니다.
  • Real-time lip-sync: MuseTalk V1.5를 사용해 호환 GPU에서 30 FPS 실시간 립싱크를 구현합니다.
  • Barge-in capability: 사용자는 아바타의 응답 중간에 끼어들 수 있으며, 시스템은 진행 중인 응답을 즉시 취소합니다.
  • Local-first option: Ollama, Whisper, 로컬 스토리지를 활용한 100% 로컬 운영을 지원합니다.
  • Production-grade infra: JWT 인증, 레이트 리밋, PostgreSQL, Redis, AWS 배포용 Terraform 스크립트를 포함한 프로덕션 수준 인프라를 제공합니다.