uezo/ChatdollKit

ChatdollKit enables you to make your 3D model into a chatbot

해결하는 문제

ChatdollKit은 3D 가상 보조자 SDK로, 개발자가 3D 모델(특히 VRM 모델)을 음성 기능이 있는 상호작용형 챗봇으로 전환할 수 있게 해줍니다. 대규모 언어 모델(LLM)과 3D 아바타 사이의 격차를 메우며, AI가 생성한 텍스트를 실시간으로 음성, 리핑싱크, 표정, 신체 애니메이션과 동기화합니다.

작동 방식

이 SDK는 Unity 기반 워크플로우에 여러 AI 구성 요소를 통합합니다:

  • LLM 통합: ChatGPT, Claude, Gemini, Dify 등의 서비스에 연결하여 대화 응답을 생성합니다. 함수 호출 및 멀티모달 기능을 지원합니다.
  • 음성 파이프라인: 듣기용 음성-텍스트 변환(STT) (예: OpenAI, Azure, Google)과 말하기용 텍스트-음성 변환(TTS) (예: VOICEVOX, Style-Bert-VITS2)을 사용합니다. 대화 흐름 제어 및 노이즈 저항을 위해 음성 활동 탐지(VAD)를 포함합니다.
  • 아바타 제어: ModelController는 3D 모델의 상태를 관리하며, LLM 응답에 포함된 태그(예: [face:Joy])를 기반으로 표정과 애니메이션을 트리거합니다.
  • 동기화: 오디오 출력을 리핑싱크 및 자율적인 깜빡임과 동기화하여 현실적인 존재감을 구현합니다.

대상 사용자

  • Unity 개발자: 가상 에이전트, AI Vtuber, 상호작용형 NPC를 만들고 싶은 사람.
  • 앱 개발자: VR, AR, WebGL 애플리케이션을 개발하고 대화형 3D 인터페이스가 필요한 사람.
  • AI 연구자/애호가: LLM을 시각적이고 감정적인 3D 캐릭터로 구현하고 싶은 사람.

주요 특징

  • 다중 플랫폼 지원: Windows, Mac, Linux, iOS, Android, VR, AR, WebGL 모두 호환.
  • 자연스러운 상호작용: AI가 말하는 도중 중단할 수 있는 '바지인'(barge-in)과 WebSocket 스트리밍 STT를 지원해 지연을 줄입니다.
  • 감정 제어: 대화 맥락에 따라 음성 스타일, 표정, 제스처를 자동으로 전환합니다.
  • 기억 및 상태: 대화 기록의 장기 기억과 동적 다국어 전환을 지원합니다.
  • 에이전트 기능: Dify 및 AIAvatarKit과의 통합을 통해 도구 호출 기능을 갖춘 AI 에이전트로 작동할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트