datascale-ai/opentalking

OpenTalking: An industrial-grade open-source AI digital human framework that supports real-time conversation, private deployment, and pluggable models.

해결하는 문제

OpenTalking은 실시간 디지털 인간 대화를 생성하기 위한 완전한 오픈소스 오케스트레이션 프레임워크를 제공합니다. 음성 인식(STT), 대규모 언어 모델(LLM), 음성 합성(TTS), 비디오 렌더링을 수동으로 연결하는 복잡성을 제거하여 상호작용 가능한 대화하는 아바타를 구축할 수 있게 합니다.

작동 방식

이 프로젝트는 프론트엔드 상호작용, 세션 상태, LLM 응답, 음성 선택, 중단 제어, WebRTC 오디오/비디오 재생을 포함한 전체 대화 파이프라인을 관리하는 프로덕션 스택으로 작동합니다. 가벼운 '모크' 모드(-API 검증용)에서부터 OmniRT를 사용한 고품질 원격 추론까지 다양한 배포 경로를 지원합니다. QuickTalk, Wav2Lip, FlashTalk 등의 다양한 디지털 인간 드라이버 모델을 통합하여 오디오 또는 텍스트 입력에 기반해 아바타를 애니메이션화합니다.

대상 사용자

의료 안내, 라이브 코머스, 가상 동반자, 뉴스 앵커 등 다양한 시나리오에서 디지털 인간 제품을 개발하는 개발자 및 크리에이터, 그리고 음성 기반 비디오 제작과 비디오 클로닝을 실험하고자 하는 사용자를 위한 것입니다.

주요 특징

  • 플러그인 가능한 백엔드: OpenAI 호환 인터페이스를 포함한 다양한 LLM, STT, TTS 제공업체를 지원합니다.
  • 유연한 배포: CPU 전용 테스트, 소비자용 GPU 로컬 설정(RTX 3090/4090), 고품질 원격 GPU/NPU 클러스터를 위한 경로를 제공합니다.
  • 포괄적인 툴셋: 아바타, 음성, 모델 설정을 관리하는 WebUI를 포함하며, 지식 기반과 캐릭터 메모리 지원도 제공합니다.
  • 다양한 렌더링 모델: 속도를 중시하는 QuickTalk, 접근성을 고려한 Wav2Lip, 비디오 클로닝 및 고품질 생성에 적합한 FasterLivePortrait를 통합합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트