OpenMOSS/MOSS-TTS

MOSS‑TTS Family is an open‑source speech and sound generation model family from MOSI.AI and the OpenMOSS team. It is designed for high‑fidelity, high‑expressiveness, and complex real‑world scenarios, covering stable long‑form speech, multi‑speaker dialogue, voice/character design, environmental sound effects, and real‑time streaming TTS.

해결하는 문제

MOSS-TTS Family는 복잡한 실제 오디오 요구 사항을 처리하도록 설계된 프로덕션급 음성 및 사운드 생성 모델 제품군을 제공합니다. 단일 TTS 모델이 고충실도 장문 음성, 표현력 있는 멀티 스피커 대화, 텍스트 기반 제로샷 보이스 디자인, 저지연 실시간 상호작용 및 환경 효과음을 동시에 제공할 수 없는 한계를 해결합니다.

작동 원리

이 프로젝트는 서로 다른 아키텍처를 기반으로 한 5개의 전문 모델로 오디오 생성 워크플로우를 분할합니다:

  • MOSS-TTS: 발음과 지속 시간을 세밀하게 제어할 수 있는 고충실도 장문 음성 및 제로샷 보이스 클로닝을 위한 플래그십 모델.
  • MOSS-TTSD: 표현력 있는 멀티 스피커의 초장문 대화를 위한 전문 모델.
  • MOSS-VoiceGenerator: 참조 오디오 없이 텍스트 프롬프트에서 다양한 목소리와 스타일을 생성하는 보이스 디자인 모델.
  • MOSS-TTS-Realtime: 증분 합성 및 컨텍스트 인식을 사용하여 대화 간 일관성을 유지하는 음성 에이전트용 저지연 모델.
  • MOSS-SoundEffect: 텍스트로부터 환경음 및 생물학적 효과음을 생성하는 모델.

MossTTSDelay(안정성 및 속도용) 및 MossTTSLocal(경량 스트리밍용)과 같은 보완적 아키텍처를 활용하며, MOSS-Audio-Tokenizer-v2를 통해 48 kHz 스테레오 출력을 지원합니다.

대상 사용자

이 프로젝트는 음성 에이전트를 구축하는 개발자, 영화 또는 게임을 제작하는 콘텐츠 크리에이터, 그리고 음성 합성 및 오디오 생성 분야의 연구자를 위한 것입니다.

주요 특징

  • 포괄적인 오디오 제품군: 음성 합성 및 대화부터 보이스 디자인 및 오디오 효과까지 모든 것을 다룹니다.
  • 다국어 지원: 코드 스위칭 기능을 포함하여 31개 언어를 지원합니다.
  • 고충실도: 네이티브 48 kHz 스테레오 입출력을 지원합니다.
  • 유연한 배포: llama.cpp 및 ONNX Runtime를 통한 PyTorch 프리 추론뿐만 아니라 SGLang-Omni 및 vLLM-Omni와 같은 가속 백엔드를 지원합니다.
  • 실시간 성능: MOSS-TTS-Realtime은 180 ms의 TTFB(Time To First Byte)를 달성했습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트