jamiepine/voicebox
The open-source AI voice studio. Clone, dictate, create.
해결하는 문제
Voicebox는 로컬 우선의 AI 음성 스튜디오로, 음성 클로닝, 음성 생성, 시스템 전체 사전 입력을 위한 통합 인터페이스를 제공합니다. ElevenLabs와 같은 클라우드 기반 음성 출력 서비스나 WisprFlow와 같은 음성 입력 서비스를 별도로 사용할 필요 없이, 사용자가 완전히 개인 정보 보호된 상태에서 모든 음성 I/O 루프를 로컬에서 실행할 수 있으며, 구독료도 발생하지 않습니다.
작동 방식
이 애플리케이션은 다양한 작업에 특화된 여러 전문 AI 모델을 통합합니다:
- 텍스트에서 음성(TTS): Qwen3-TTS, Kokoro, LuxTTS를 포함한 7가지 TTS 엔진을 통합하여 다국어 클로닝과 표현력 있는 음성 생성을 처리합니다.
- 음성에서 텍스트(STT): OpenAI Whisper를 사용하여 사전 입력 및 오디오 캡처에 대한 고품질 번역을 제공합니다.
- 로컬 LLM: 포함된 Qwen3 LLM은 텍스트 정제(사전 입력 시 끊김 제거) 및 "음성 성격" 기능을 처리하며, 특정 캐릭터의 스타일에 맞게 텍스트를 재작성하여 음성 출력 전에 변환합니다.
- 통합: Tauri(Rust)와 FastAPI(Python)로 구축되어 REST API와 MCP(Model Context Protocol) 서버를 노출하여, Claude Code나 Cursor와 같은 AI 에이전트가 클로닝된 목소리를 사용해 발화할 수 있도록 합니다.
대상 사용자
- 콘텐츠 제작자: 멀티보이스 타임라인 에디터를 사용해 팟캐스트, 서사, 게임 대사 등을 제작하는 사람.
- 개발자: 로컬이고 개인 정보 보호가 가능한 음성 인터페이스가 필요한 AI 에이전트를 개발하는 사람.
- 접근성 사용자: 로컬에서 작동하는 음성 보조 도구가 필요한 사람.
- 에이전트형 AI 사용자: MCP 대응 에이전트를 사용해 AI 어시스턴트가 독특하고 클로닝된 목소리를 갖기를 원하는 사람.
주요 기능
- 로컬 우선의 프라이버시: 모든 모델과 음성 데이터는 사용자의 기기 내에 유지됩니다.
- uma 7 TTS 엔진: 23개 언어를 지원하며, 짧은 오디오 샘플에서 제로샷 음성 클로닝이 가능합니다.
- 시스템 전체 사전 입력: macOS에서 포커스된 앱에 직접 텍스트를 붙여넣을 수 있는 글로벌 핫키를 통한 푸시 투 톡 사전 입력.
- MCP 서버: 모델 컨텍스트 프로토콜(MCP)을 내장 지원하여 AI 에이전트가 음성 출력을 트리거할 수 있습니다.
- 스토리 에디터: 복잡한 대화나 팟캐스트를 구성하기 위한 멀티트랙 타임라인.
- 오디오 효과: Spotify의 pedalboard로 구동되는 피치 시프트, 리버브, 압축 등의 통합 후처리 효과.
- 광범위한 하드웨어 지원: Apple Silicon(MLX), NVIDIA(CUDA), AMD(ROCm), Intel Arc GPU에 최적화되어 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트