OpenMOSS/MOSS-TTSD
MOSS-TTSD is a spoken dialogue generation model designed for expressive multi-speaker synthesis. It features long-context modeling, flexible speaker control, and multilingual support, while enabling zero-shot voice cloning from short audio references.
해결하는 문제
MOSS-TTSD는 단일 화자 독백에 최적화된 기존 텍스트-to-음성(TTS) 시스템의 한계를 해결합니다. 정적 대사 스크립트를 일관되고 지속적인 다중 화자 대화로 변환하며, 긴 형식의 오디오 생성에서도 화자 정체성과 감정적 뉘앙스를 유지합니다.
작동 방식
사용자는 각 화자(최대 5명까지)의 참조 음성과 대사 텍스트를 제공합니다. 이후 제공된 스크립트를 기반으로 자연스러운 대화 흐름과 일관된 인물 설정을 유지하며 음성 대사를 생성합니다. 고성능 배포를 위해서는 MOSS-Audio-Tokenizer와 통합하여 SGLang 추론 엔진을 통해 실행할 수 있어 생성 속도를 크게 향상시킬 수 있습니다.
대상 사용자
AI 기반 포드캐스트, 오디오북, 스포츠 및 e스포츠 해설, 자막 번역, 엔터테인먼트 미디어 등 긴 형식의 오디오 경험을 구축하는 콘텐츠 제작자 및 개발자에게 적합합니다.
주요 특징
- 다중 화자 대화: 1~5명의 화자를 지원하며, 겹치는 발화와 자연스러운 대화 리듬을 유연하게 제어 가능.
- 극장의 긴 컨텍스트: 한 세션에서 최대 60분의 일관된 음성 생성이 가능하며, 화자 정체성이 일관되게 유지됨.
- 제로샷 음성 클론: 짧은 참조 음성 샘플만으로도 고해상도 음성 클론이 가능.
- 다국어 지원: 중국어, 영어, 일본어 및 다양한 유럽 언어를 포함한 20개 언어에서 우수한 성능을 발휘.
- 고속 추론: SGLang 통합을 통해 추론 속도가 최대 16배 가속화됨.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트