Open-LLM-VTuber/Open-LLM-VTuber
Talk to any LLM with hands-free voice interaction, voice interruption, and Live2D taking face running locally across platforms
What it solves
Open-LLM-VTuber는 시각적 존재감을 가진 음성 인터랙티브 AI 동반자를 만듭니다. 사용자는 커스터마이징 가능한 Live2D 아바타와 실시간 멀티모달 대화를 할 수 있으며, 로컬 머신에서 완전히 오프라인으로 실행되어 폐쇄형 AI VTuber에 대한 사적인 대안을 제공합니다.
How it works
이 프로젝트는 세 가지 주요 AI 구성 요소를 하나의 시스템으로 통합합니다: 인텔리전스를 담당하는 Large Language Model(LLM), 청각을 담당하는 Automatic Speech Recognition(ASR), 발화를 담당하는 Text-to-Speech(TTS). 이들은 Live2D 아바타와 연결되어 표정과 움직임으로 반응합니다. Ollama, OpenAI, 로컬 GGUF 모델 등 다양한 백엔드를 지원하며, 웹 인터페이스와 투명하고 항상 위에 표시되는 오버레이인 "펫 모드"를 갖춘 데스크톱 클라이언트를 제공합니다.
Who it’s for
개인화된 AI 동반자(가상 파트너나 펫 등)를 원하는 사용자, VTuber 애호가, 시각 및 청각 피드백을 갖춘 인터랙티브 AI 에이전트를 구축하려는 개발자를 위해 설계되었습니다.
Highlights
- Multimodal Interaction: 카메라, 화면 녹화, 스크린샷을 통한 시각 인식과 클릭 및 드래그를 통한 터치 피드백을 지원합니다.
- Privacy-First: 로컬 모델을 사용해 완전 오프라인으로 실행할 수 있습니다.
- Live2D Integration: 감정 매핑을 통해 아바타 표정을 제어하고 투명한 "데스크톱 펫" 모드를 제공합니다.
- Broad Compatibility: Windows, macOS, Linux를 지원하며 다양한 LLM, ASR, TTS 제공자를 통합합니다.
- Advanced Audio: 음성 중단 처리(AI가 자신의 목소리를 듣지 않도록)와 TTS 번역 지원을 포함합니다.