PunithVT/ai-avatar-system

🎭 AI Avatar / digital human platform — upload a photo, clone a voice, talk to any face in real time with lip-sync video. Open-source, self-hosted. Claude · Whisper · Chatterbox · MuseTalk.

해결하는 문제

AvatarAI는 실시간 대화가 가능한 사실적인 AI 아바타를 생성하기 위한 프로덕션 준비 완료 플랫폼을 제공합니다. 정적 AI 채팅과 몰입형 디지털 인간 사이의 격차를 해소하기 위해 음성 인식(STT), LLM, 음성 클론, 리프싱크 영상 생성을 하나의 낮은 지연 시간 파이프라인으로 통합합니다.

작동 방식

시스템은 지연을 최소화하기 위해 스트리밍 파이프라인을 사용합니다. 사용자가 말하면 Whisper STT가 오디오를 텍스트로 변환하고, LLM(Claude, GPT-4o, 또는 Ollama를 통해 로컬 모델)로 전송됩니다. 생성된 텍스트는 문장으로 분할되어 병렬 처리됩니다. 각 문장은 Chatterbox TTS(제로샷 음성 클론 지원)를 통해 음성으로 변환된 후 MuseTalk V1.5 엔진을 사용해 애니메이션 처리되어 리프싱크 영상 조각을 생성합니다. 이 조각들은 WebSockets를 통해 브라우저로 스트리밍되어, LLM이 전체 응답을 완료하기 전에도 아바타가 말하기 시작할 수 있습니다.

대상 사용자

연구용 데모가 아니라 다중 사용자 웹 서비스를 위한 디지털 인간을 배포하고자 하는 개발자 및 기업을 위한 것입니다. 개인정보 보호를 위해 시스템을 100% 로컬에서 실행하고 싶거나, AWS GPU 인스턴스에 배포하여 고성능 실시간 상호작용을 원하는 사용자에게 적합합니다.

주요 특징

  • 실시간 리프싱크: GPU에서 최대 30 FPS를 달성하는 MuseTalk V1.5 사용.
  • 제로샷 음성 클론: 10초 오디오 샘플로 23개 언어에서 음성 클론 가능.
  • 버지인 기능: 아바타의 응답 도중 사용자가 중단할 수 있어 더 자연스러운 대화 가능.
  • 다중 LLM 지원: Claude, GPT-4o, 그리고 Ollama, vLLM, LM Studio와 같은 로컬 엔진과 호환.
  • 프로덕션 수준 인프라: JWT 인증, 레이트 제한, PostgreSQL 데이터베이스, AWS Terraform 스크립트를 포함한 배포 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트