kyutai-labs/unmute
Make text LLMs listen and speak
해결하는 문제
Unmute는 일반적인 텍스트 기반 대규모 언어 모델(LLM)이 실시간 음성 대화에 참여할 수 있도록 합니다. 고성능 음성-텍스트(STT) 및 텍스트-음성(TTS) 모델을 통합하여 음성 인터페이스에서 일반적으로 발생하는 지연을 줄이고, 텍스트 기반 LLM과 음성 상호작용 사이의 격차를 메웁니다.
작동 방식
Unmute는 전용 오디오 모델로 텍스트 LLM을 래핑하는 오케스트레이션 계층으로 작동합니다:
- 음성-텍스트 변환(STT): 웹소켓 연결을 통해 사용자 오디오 입력을 실시간으로 텍스트로 변환합니다.
- LLM 처리: STT가 사용자의 말이 끝났음을 감지하면, 변환된 텍스트가 LLM(Gemma 3 또는 OpenRouter/vLLM을 통한 모델 등)에 전달되어 텍스트 응답을 생성합니다.
- 텍스트-음성 변환(TTS): LLM의 텍스트 출력을 TTS 엔진에 스트리밍하여 다시 음성으로 변환하고 사용자에게 전달합니다.
대상 사용자
- 기존 텍스트 LLM에 저지연 음성 기능을 추가하고 싶은 개발자.
- 실시간 오디오-텍스트-오디오 파이프라인을 실험하고 싶은 연구자.
- 오픈소스 모델을 사용해 사생활 보호가 가능한 음성 지원 AI 어시스턴트를 자체 호스팅하고 싶은 자체 호스팅 사용자.
주요 특징
- 저지연: 원활한 대화를 보장하는 최적화된 STT 및 TTS 구성 요소.
- LLM 독립성: OpenAI 호환 LLM 서버(vLLM, Ollama, OpenRouter)와 호환 가능.
- 유연한 배포: Docker Compose를 통한 간편한 설정, Docker 없이 수동 제어, Docker Swarm을 통한 확장 지원.
- 사용자 정의 음성: 설정 파일을 통해 캐릭터와 음성 변경 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트