Qwen3-TTS-Flash 업데이트: 49개의 음색, 10개 언어, 9개 방언

Qwen은 다중 음색, 언어 및 방언에 걸쳐 자연스럽고 표현력 있는 음성 합성을 위해 설계된 대표 텍스트‑투‑스피치(TTS) 모델인 Qwen3‑TTS‑Flash에 대한 업데이트를 발표했습니다. 이번 업데이트를 통해 모델의 음성 다양성과 언어 범위가 크게 확대되었으며, Qwen API를 통해 제공됩니다.

확장된 음색 및 페르소나 지원

Qwen3‑TTS‑Flash는 이제 49개가 넘는 고품질 음색을 제공합니다. 이러한 음성은 다양한 성별, 연령, 지역 특성 및 캐릭터 프로필을 포괄하여 여러 적용 시나리오에 맞춥니다. 구체적인 캐릭터 페르소나는 다음과 같습니다:

  • Momo: 장난스럽고 독특함
  • Ono Anna: 따뜻하고 든든한 어린 시절 친구
  • Vivian: 자부심 있고 솔직한 "강인한 소녀"
  • Elias: 엄격한 강사
  • Eldric Sage: 현명한 장로
  • Bunny: 귀여운 로리

다국어 및 다방언 기능

전 세계 언어 지원

이 모델은 중국어, 영어, 독일어, 이탈리아어, 포르투갈어, 스페인어, 일본어, 한국어, 프랑스어, 러시아어 등 10개의 주요 언어를 지원합니다. MiniMax TTS 다국어 테스트 세트를 사용한 성능 벤치마크에서 Qwen3‑TTS‑Flash는 GPT‑4o‑Audio‑Preview, ElevenLabs, MiniMax보다 평균 단어 오류율(WER)이 낮은 결과를 보였습니다.

중국 방언 합성

Qwen3‑TTS‑Flash는 9개의 중국 방언에 대해 현지 억양과 언어적 뉘앙스를 진정성 있게 재현합니다:

  • 표준어
  • 복건어
  • 우어
  • 광동어
  • 사천어
  • 베이징어
  • 난징어
  • 톈진어
  • 산시어

운율 및 인간성 향상

Qwen3‑TTS‑Flash는 제공된 텍스트 입력을 기반으로 말하기 속도와 운율에 대한 적응형 조정을 강화했습니다. 이전 버전과 비교했을 때, 이러한 개선으로 리듬과 억양 측면에서 실제 인간 대화에 더욱 가깝게 다가가는 음성을 생성합니다.

기술 구현 및 API 사용법

개발자는 qwen3-tts-flash-2025-11-27 모델 식별자를 사용하여 DashScope SDK를 통해 모델에 접근할 수 있습니다. API를 통해 사용자는 voice(음색)와 language_type을 지정하여 올바른 발음과 자연스러운 억양을 보장할 수 있습니다.

import dashscope

response = dashscope.MultiModalConversation.call(
    model="qwen3-tts-flash-2025-11-27",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    text=text,
    voice="Ryan",
    language_type="English",
    stream=False
)

Sources