Qwen-TTS 업데이트: 중국 방언 및 이중 언어 합성 지원

Qwen은 텍스트-음성 변환 모델인 Qwen-TTS (qwen-tts-latest 또는 qwen-tts-2025-05-22)에 업데이트를 도입했으며, 이는 인간 수준의 자연스러움과 표현력을 갖춘 음성 생성을 가능하게 합니다. 이번 업데이트는 특히 베이징어, 상하이어, 쓰촨어라는 세 가지 특정 중국 방언을 합성할 수 있는 능력과 중국어-영어 이중 언어 음성 지원으로 주목받고 있습니다.

방언 지원 및 음성 옵션

Qwen-TTS는 이제 세 가지 중국 방언의 생성을 지원하여 모델이 지역별 말투와 자연스러운 억양을 포착할 수 있게 합니다. 사용 가능한 음성은 방언별 또는 이중 언어 기능별로 구분됩니다:

  • 베이징어: Dylan
  • 상하이어: Jada
  • 쓰촨어: Sunny
  • 이중 언어 (중국어-영어): Cherry, Ethan, Chelsie, and Serena

기술 역량 및 성능

Qwen-TTS는 수백만 시간에 달하는 음성 데이터를 포함한 대규모 데이터셋으로 학습되었습니다. 이 학습을 통해 모델은 입력 텍스트에 따라 운율, 속도, 감정 억양을 자동으로 조정하여 높은 수준의 자연스러움을 달성합니다.

성능 벤치마크

모델의 성능은 SeedTTS-Eval 벤치마크를 사용해 평가되었습니다. 이중 언어 화자에 대한 결과는 다음과 같습니다:

화자 WER (zh) WER (en) WER (hard) SIM (zh) SIM (en) SIM (hard)
Chelsie 1.256 2.004 6.171 0.658 0.473 0.662
Serena 1.495 2.206 7.394 0.804 0.508 0.803
Ethan 1.489 1.969 6.754 0.777 0.558 0.779
Cherry 1.209 1.967 6.069 0.799 0.664 0.801

API 통합

Qwen-TTS는 Qwen API를 통해 제공됩니다. 개발자는 dashscope Python 라이브러리를 사용해 모델을 통합할 수 있습니다. 합성 과정은 지정된 모델(예: qwen-tts-latest), 대상 텍스트 및 선택한 음성을 사용해 SpeechSynthesizer.call 메서드를 호출하는 방식으로 진행됩니다.

import os
import requests
import dashscope

def synthesize_speech(text, voice="Dylan", model="qwen-tts-latest"):
    api_key = os.getenv("DASHSCOPE_API_KEY")
    response = dashscope.audio.qwen_tts.SpeechSynthesizer.call(
        model=model,
        api_key=api_key,
        text=text,
        voice=voice,
    )
    return response.output.audio["url"]

Sources