PowerBeef/Vocello

Vocello: a local, private voice studio for Apple Silicon. Write a script, pick or describe a voice, and generate speech on-device, faster than realtime on an 8 GB M2 Mac mini. Native Swift + MLX, no Python. Mac app out now, iPhone beta on TestFlight. (Formerly QwenVoice.)

해결하는 문제

Vocello는 macOS 및 iOS용 로컬 우선형 고성능 텍스트 음성 합성(TTS) 스튜디오입니다. 생성형 AI 음성 모델을 Apple Silicon 하드웨어에서 직접 실행함으로써 클라우드 기반 크레딧, 계정, 외부 서버의 필요성을 제거하여 모든 스크립트와 녹음이 사용자의 디바이스 내에서 완전히 비공개로 유지됨을 보장합니다.

작동 방식

애플의 머신러닝 프레임워크인 MLX 기반의 네이티브 Swift 런타임을 사용하여 Qwen3-TTS 모델을 실행합니다. 많은 로컬 TTS 도구가 Python 래퍼에 의존하는 반면, Vocello는 전용 1차 런타임(VocelloQwen3Core)을 사용해 오디오를 생성합니다. 주로 세 가지 주요 워크플로우를 지원합니다: 내장 음성 사용, 일반 언어 설명을 통한 새로운 음성 설계, 오디오 참조를 통한 기존 음성 클론.

대상 사용자

Apple Silicon 맥(맥OS 26+) 및 iPhone 15 Pro 이상(아이오스 26+)을 사용하며, 스크립트, 장편 프로젝트, 커스텀 음성 캐릭터용 고품질 비공개 음성 생성이 필요한 사용자에게 적합합니다.

주요 특징

  • 로컬 우선 개인정보 보호: 모든 생성, 기록, 음성 참조는 로컬에 저장되며, 데이터는 디바이스 외부로 나가지 않습니다.
  • 음성 설계 및 클론: 텍스트 설명으로 음성을 생성하거나 오디오 파일/녹음으로부터 음성 클론을 생성할 수 있습니다.
  • 고성능: Apple Silicon에 최적화되어 8GB RAM 기기에서도 실시간을 초과하는 속도로 생성이 가능합니다.
  • 장편 지원: 900자 이상의 스크립트를 스트리밍 세그먼트로 처리하여 메모리 사용량을 일정하게 낮게 유지합니다.
  • 다국어 지원: 영어, 중국어, 일본어, 한국어, 독일어, 프랑스어, 러시아어, 포르투갈어, 스페인어, 이탈리아어 등 10개 언어를 지원합니다.
  • 결정론적 출력: 재현 가능한 오디오 테이크를 위해 시드 핀을 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트