lucasjinreal/Kokoros
🔥🔥 Kokoro in Rust. https://huggingface.co/hexgrad/Kokoro-82M Insanely fast, realtime TTS with high quality you ever have.
해결하는 문제
Kokoros는 고품질 오디오 출력을 통해 매우 빠른 텍스트 음성 변환(TTS) 합성을 제공하도록 설계된 Kokoro TTS 모델의 고성능 Rust 구현체입니다. 독립 실행형 바이너리와 Rust 크레이트를 제공하여 무거운 Python 의존성 없이도 다른 애플리케이션에 쉽게 통합할 수 있습니다.
작동 방식
이 프로젝트는 ONNX Runtime를 통해 Kokoro 82M 파라미터 모델을 사용하여 추론을 수행합니다. 엔드투엔드 텍스트 처리를 위해 내장된 포네마이저(phonemizer)와 토크나이저(Espeak-ng 지원)를 포함합니다. 이 시스템은 명령줄 도구(koko), Rust 라이브러리 또는 처리량을 최적화하기 위해 스트리밍 오디오 생성 및 병렬 처리를 지원하는 OpenAI 호환 HTTP API 서버로 사용할 수 있습니다.
대상 사용자
- Rust 애플리케이션에 고품질 TTS를 임베딩하려는 개발자
- 오디오 합성을 위한 빠르고 가벼운 CLI 도구를 찾는 사용자
- 저지연 스트리밍 오디오 응답이 필요한 AI 에이전트 또는 디지털 휴먼을 구축하는 엔지니어
주요 특징
- 놀라운 추론 속도: Rust로 속도를 최적화하였으며, CUDA 및 WASM을 지원합니다.
- OpenAI 호환: 쉬운 통합을 위해 OpenAI TTS 엔드포인트를 모방한 API 서버를 제공합니다.
- 스트리밍 지원: 즉각적인 오디오 재생(낮은 Time-to-first-audio)을 위해 CLI 및 HTTP API 스트리밍을 모두 지원합니다.
- 스타일 믹싱: 사용자 정의 음성 효과를 위해 서로 다른 음성 스타일(예:
af_sky.4 + af_nicole.5)을 혼합할 수 있습니다. - 단어 단위 타임스탬프: 각 단어의 정확한 시작 및 종료 시간을 제공하는
.tsv사이드카 파일을 생성할 수 있습니다. - 엔드투엔드: 내부 포네마이징을 포함하여 외부 의존성의 필요성을 제거했습니다.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트