OpenMOSS/MOSS-TTS-Nano
MOSS-TTS-Nano is an open-source multilingual tiny speech generation model from MOSI.AI and the OpenMOSS team. With only 0.1B parameters, it is designed for realtime speech generation, can run directly on CPU without a GPU, and keeps the deployment stack simple enough for local demos, web serving, and lightweight product integration.
해결하는 문제
MOSS-TTS-Nano는 실시간 애플리케이션을 위한 고품질 다국어 음성 생성을 가능하게 하도록 설계되었습니다. 일반적으로 리소스를 많이 소모하는 텍스트 음성 변환(TTS) 시스템을 배포하는 어려움을 해결하기 위해, 작은 크기와 낮은 지연을 갖춘 모델을 제공하여 GPU 없이도 일반 CPU에서 효율적으로 작동할 수 있도록 합니다.
작동 방식
이 프로젝트는 오디오 토크나이저와 대규모 언어 모델(LLM)로 구성된 순수 자기회귀 파이프라인을 사용합니다. 구체적으로, 인과적 Transformer 블록 기반의 CNN 없는 경량 토크나이저인 MOSS-Audio-Tokenizer-Nano를 활용하여 48kHz 스테레오 오디오를 토큰 스트림으로 압축합니다. 이후 LLM이 이 토큰을 생성하여 음성을 생성합니다. 배포를 위해 PyTorch 종속성을 제거한 ONNX CPU 버전을 제공하여 처리 효율을 크게 향상시키고 단일 CPU 코어에서도 실행 가능하게 합니다.
대상 사용자
- 로컬 데모, 웹 서비스, 모바일 애플리케이션(안드로이드 포함)에 경량 TTS를 통합하고자 하는 개발자.
- 최소한의 인프라 비용으로 실시간 다국어 음성 생성이 필요한 제품 팀.
- 소형이고 효율적인 자기회귀 오디오 모델에 관심이 있는 연구자.
주요 특징
- 소형 모델 크기: 단지 0.1B 파라미터.
- CPU 친화적: 4코어 CPU에서 스트리밍 생성이 가능하며, ONNX를 통해 단일 코어에서도 부드러운 추론이 가능.
- 다국어 지원: 중국어, 영어, 독일어, 스페인어, 프랑스어 등을 포함한 20개 언어 지원.
- 고음질: 네이티브 48kHz, 2채널(스테레오) 오디오 출력.
- 보이스 클론: 참조 오디오 프롬프트를 사용한 보이스 클론 지원.
- 유연한 배포: 패키지 CLI, FastAPI 웹 데모, ONNX 런타임 지원 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트