lipku/LiveTalking

Real time interactive streaming digital human

해결하는 문제

LiveTalking은 디지털 인간을 위한 실시간 상호작용 스트리밍 엔진입니다. 가상 아바타가 텍스트나 음성 입력에 응답하여 현실적인 입모양 동기화를 통해 말할 수 있도록 하여, 라이브 스트리밍, 고객 서비스, 교육 분야에서 원활한 상호작용을 가능하게 하는 생생한 음성-영상 동기화 대화 시스템을 구축하는 문제를 해결합니다.

작동 방식

시스템은 다음과 같은 파이프라인을 따릅니다: 사용자 입력(텍스트/음성) → LLM(대화 생성) → TTS(음성 합성) → 디지털 인간 모델(입모양 동기화) → 스트리밍 출력.

모듈러 아키텍처를 사용합니다:

  • API 레이어: 세션을 관리하고 /human/humanaudio 엔드포인트를 통해 요청을 처리합니다.
  • 로직 레이어: Qwen과 같은 LLM과 EdgeTTS, GPT-SoVITS, CosyVoice 등의 다양한 TTS 엔진을 통합하여 음성을 생성합니다.
  • 렌더링 레이어: Wav2Lip, MuseTalk, ER-NeRF와 같은 딥러닝 모델을 사용하여 음성 특징에 기반한 입모양 프레임을 생성합니다.
  • 스트리밍 레이어: WebRTC(저지연), RTMP(방송용), 또는 가상 카메라로 비디오 스트림을 전달합니다.

대상 사용자

이 프로젝트는 다음 용도로 AI 아바타를 구현하고자 하는 개발자 및 기업을 위한 것입니다:

  • 가상 스트리머: 자동 스크립트를 사용한 24시간 365일 무인 라이브 스트리밍.
  • AI 고객 서비스: 기업 지식 기반과 실시간 음성 상호작용.
  • 온라인 교육: 실시간 또는 녹화된 수업용 디지털 강사 클론 생성.
  • 스마트 음성 어시스턴트: 앱이나 스마트 스피커에 디지털 인간 통합.
  • 콘텐츠 크리에이터: 실제 촬영 없이 짧은 영상 일괄 제작.

주요 특징

  • 다중 모델 지원: ernerf, musetalk, wav2lip, Ultralight-Digital-Human과 호환.
  • 저지연: 실시간 브라우저 기반 상호작용을 위한 WebRTC 지원.
  • 음성 클로닝: 아바타의 목소리를 개인화할 수 있는 음성 클로닝 기능 통합.
  • 인터럽트 가능한 대화: 아바타가 말하는 중에도 사용자가 중단 가능.
  • 유연한 출력: WebRTC, RTMP, 가상 카메라 출력 지원.
  • 액션 오케스트레이션: 아바타가 말하지 않을 때 사용자 정의 동영상 재생 가능.
  • 사용자 정의 아바타: 사용자 정의 디지털 인간 이미지 생성 및 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트