Qwen3-TTS 릴리즈 노트: 오픈소스 음성 디자인, 클로닝 및 생성
Qwen은 Qwen3-TTS 패밀리를 오픈소스화했으며, 고충실도 음성 클로닝, 자연어 기반 음성 디자인, 그리고 정밀한 음향 제어가 가능한 일련의 음성 생성 모델을 공개했습니다. 0.6B와 1.7B 파라미터 규모로 제공되며, 10개의 주요 언어와 다양한 방언을 지원해 실시간 인터랙티브 음성 애플리케이션을 위한 다목적 툴킷을 제공합니다.
기술 아키텍처 및 핵심 혁신
Qwen3-TTS는 이산 다중 코드북 언어 모델(LM) 아키텍처를 활용해 완전 정보 기반 엔드투엔드 음성 모델링을 구현합니다. 이 접근 방식은 기존 LM+DiT(디퓨전 트랜스포머) 방식에서 흔히 발생하는 정보 병목과 연쇄 오류를 제거합니다.
Qwen3-TTS-Tokenizer-12Hz
시스템은 Qwen3-TTS-Tokenizer-12Hz 다중 코드북 음성 인코더에 의해 구동됩니다. 이 토크나이저는 효율적인 음향 압축과 고차원 의미 모델링을 가능하게 하면서, 부언어 정보와 음향 환경 특성을 보존합니다. 이를 통해 경량 비-DiT 아키텍처로 고속·고충실도 음성 재구성이 가능합니다.
듀얼-트랙 스트리밍 생성
실시간 인터랙션 요구를 충족하기 위해 Qwen3-TTS는 듀얼-트랙 하이브리드 스트리밍 생성 아키텍처를 구현했습니다. 하나의 모델이 스트리밍과 비스트리밍 생성을 모두 지원하며, 단일 문자만 처리한 뒤 첫 오디오 패킷을 전달합니다. 엔드투엔드 합성 지연은 최소 97ms에 달합니다.
모델 변형 및 기능
Qwen3-TTS 패밀리는 두 가지 주요 규모로 나뉩니다: 최고 성능과 제어를 위한 1.7B 모델, 효율성을 위한 0.6B 모델.
| 모델 | 주요 기능 | 언어 지원 | 스트리밍 | 명령 제어 |
|---|---|---|---|---|
| Qwen3-TTS-12Hz-1.7B-VoiceDesign | 자연어 설명을 통한 음성 디자인 | 10개 언어 | Yes | Yes |
| Qwen3-TTS-12Hz-1.7B-CustomVoice | 대상 음색에 대한 스타일 제어; 프리미엄 음색 9종 | 10개 언어 | Yes | Yes |
| Qwen3-TTS-12Hz-1.7B-Base | 3초 빠른 음성 클론; 파인튜닝을 위한 베이스 | 10개 언어 | Yes | No |
| Qwen3-TTS-12Hz-0.6B-CustomVoice | 프리미엄 음색 9종 | 10개 언어 | Yes | No |
| Qwen3-TTS-12Hz-0.6B-Base | 3초 빠른 음성 클론; 파인튜닝을 위한 베이스 | 10개 언어 | Yes | No |
지원되는 언어에는 중국어, 영어, 일본어, 한국어, 독일어, 프랑스어, 러시아어, 포르투갈어, 스페인어 및 이탈리아어가 포함됩니다.
주요 기능
자연어 음성 디자인
사용자는 자유 형식의 자연어 설명을 제공하여 완전히 새로운 음성 정체성을 만들 수 있습니다. 여기에는 음향 속성(피치, 속도, 볼륨), 페르소나 설명, 배경 정보 지정이 포함됩니다. 모델은 이러한 지시와 텍스트 의미에 따라 톤, 리듬, 감정 표현을 조정합니다.
빠른 음성 클로닝 및 교차 언어 일반화
Base 모델은 3초 길이의 오디오 샘플만으로 빠른 음성 클로닝을 수행합니다. 이 기능은 교차 언어 클로닝까지 확장되어, 화자의 음색을 다양한 언어에 걸쳐 유지할 수 있습니다.
정밀 음향 제어
Qwen3-TTS는 음성 출력에 대한 다차원 제어를 지원합니다:
- 단일 속성 제어: 감정(예: "매우 화난")이나 속도(예: "극히 느린")와 같은 특정 요소 조정.
- 다중 속성 제어: 성별, 피치, 속도, 성격 특성을 복합 프롬프트로 결합.
- 음색 재사용: 특정 음색을 저장·불러와 다중 캐릭터·장문 대화를 생성.
성능 벤치마크
음성 디자인 및 제어
InstructTTS-Eval 벤치마크에서 Qwen3-TTS-VoiceDesign은 폐쇄형 MiniMax-Voice-Design 모델을 지시 수행도와 생성 표현력 모두에서 앞섰습니다. 음성 제어 작업에서는 Qwen3-TTS-Instruct가 InstructTTS-Eval에서 75.4% 점수를 기록했으며, 다언어 단일 화자 일반화에서 Word Error Rate(WER) 2.34%를 유지했습니다.
음성 클로닝
Seed-tts-eval 벤치마크에서 Qwen3-TTS는 중국어와 영어 클로닝에서 MiniMax와 SeedTTS를 능가하는 음성 안정성을 보였습니다. 10개 언어 다언어 테스트 세트에서 평균 WER 1.835%와 화자 유사도 0.789를 달성해 MiniMax와 ElevenLabs를 앞섰습니다.
토크나이저 품질
LibriSpeech test-clean 세트에서 Qwen-TTS-Tokenizer는 여러 지표에서 SOTA 결과를 기록했습니다:
- PESQ: 와이드밴드 3.21, 나로우밴드 3.68.
- STOI: 0.96
- UTMOS: 4.16
- 화자 유사도: 0.95
SUMMARY: Qwen은 Qwen3-TTS 패밀리를 오픈소스화했으며, 0.6B 및 1.7B 모델을 통해 고충실도 음성 클로닝, 자연어 기반 음성 디자인, 그리고 10개 언어에 걸친 초저지연 스트리밍 음성 생성을 가능하게 합니다.
TITLE: Qwen3-TTS 릴리즈 노트: 오픈소스 음성 디자인, 클로닝 및 생성