Qwen-TTS 업데이트: 중국 방언 및 이중 언어 합성 지원
Qwen은 텍스트-음성 변환 모델인 Qwen-TTS (qwen-tts-latest 또는 qwen-tts-2025-05-22)에 업데이트를 도입했으며, 이는 인간 수준의 자연스러움과 표현력을 갖춘 음성 생성을 가능하게 합니다. 이번 업데이트는 특히 베이징어, 상하이어, 쓰촨어라는 세 가지 특정 중국 방언을 합성할 수 있는 능력과 중국어-영어 이중 언어 음성 지원으로 주목받고 있습니다.
방언 지원 및 음성 옵션
Qwen-TTS는 이제 세 가지 중국 방언의 생성을 지원하여 모델이 지역별 말투와 자연스러운 억양을 포착할 수 있게 합니다. 사용 가능한 음성은 방언별 또는 이중 언어 기능별로 구분됩니다:
- 베이징어: Dylan
- 상하이어: Jada
- 쓰촨어: Sunny
- 이중 언어 (중국어-영어): Cherry, Ethan, Chelsie, and Serena
기술 역량 및 성능
Qwen-TTS는 수백만 시간에 달하는 음성 데이터를 포함한 대규모 데이터셋으로 학습되었습니다. 이 학습을 통해 모델은 입력 텍스트에 따라 운율, 속도, 감정 억양을 자동으로 조정하여 높은 수준의 자연스러움을 달성합니다.
성능 벤치마크
모델의 성능은 SeedTTS-Eval 벤치마크를 사용해 평가되었습니다. 이중 언어 화자에 대한 결과는 다음과 같습니다:
| 화자 | WER (zh) | WER (en) | WER (hard) | SIM (zh) | SIM (en) | SIM (hard) |
|---|---|---|---|---|---|---|
| Chelsie | 1.256 | 2.004 | 6.171 | 0.658 | 0.473 | 0.662 |
| Serena | 1.495 | 2.206 | 7.394 | 0.804 | 0.508 | 0.803 |
| Ethan | 1.489 | 1.969 | 6.754 | 0.777 | 0.558 | 0.779 |
| Cherry | 1.209 | 1.967 | 6.069 | 0.799 | 0.664 | 0.801 |
API 통합
Qwen-TTS는 Qwen API를 통해 제공됩니다. 개발자는 dashscope Python 라이브러리를 사용해 모델을 통합할 수 있습니다. 합성 과정은 지정된 모델(예: qwen-tts-latest), 대상 텍스트 및 선택한 음성을 사용해 SpeechSynthesizer.call 메서드를 호출하는 방식으로 진행됩니다.
import os
import requests
import dashscope
def synthesize_speech(text, voice="Dylan", model="qwen-tts-latest"):
api_key = os.getenv("DASHSCOPE_API_KEY")
response = dashscope.audio.qwen_tts.SpeechSynthesizer.call(
model=model,
api_key=api_key,
text=text,
voice=voice,
)
return response.output.audio["url"]