Qwen3-TTS-Flash 更新:49 種音色、10 種語言與 9 種方言

Qwen 已發布 Qwen3-TTS-Flash 的更新,這是一款旗艦級文字轉語音(TTS)模型,旨在於多種音色、語言與方言之間實現自然且富有表情的語音合成。此更新大幅擴展了模型的聲音多樣性與語言覆蓋,並透過 Qwen API 提供使用。

擴充的音色與角色支援

Qwen3-TTS-Flash 現在提供超過 49 種高品質音色。這些聲音涵蓋廣泛的性別、年齡、地域特徵與角色設定,以符合各種應用情境。具體的角色人物包括:

  • Momo:活潑且古怪
  • Ono Anna:溫暖且支持的童年好友
  • Vivian:驕傲且直率的「硬妹」
  • Elias:嚴格的教官
  • Eldric Sage:智慧的長者
  • Bunny:可愛的蘿莉

多語言與多方言能力

全球語言支援

模型支援 10 種主要語言:中文、英文、德文、義大利文、葡萄牙文、西班牙文、日文、韓文、法文與俄文。於使用 MiniMax TTS 多語言測試集進行效能基準測試時,Qwen3-TTS-Flash 的平均字錯誤率(WER)低於 GPT-4o-Audio-Preview、ElevenLabs 與 MiniMax。

中文方言合成

Qwen3-TTS-Flash 為九種中文方言提供真實的地方口音與語言細微差異再現:

  • 官話
  • 閩南語
  • 吳語
  • 粵語
  • 四川話
  • 北京話
  • 南京話
  • 天津話
  • 陝西話

韻律與擬人化的改進

Qwen3-TTS-Flash 具備根據提供的文字輸入進行語速與韻律的增強自適應調整。相較於先前版本,這些改進使語音在節奏與語調上更貼近真實的人類對話。

技術實作與 API 使用方式

開發者可透過 DashScope SDK 使用模型識別碼 qwen3-tts-flash-2025-11-27 來存取此模型。API 允許使用者指定 voice(音色)與 language_type,以確保正確的發音與自然的語調。

import dashscope

response = dashscope.MultiModalConversation.call(
    model="qwen3-tts-flash-2025-11-27",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    text=text,
    voice="Ryan",
    language_type="English",
    stream=False
)

Sources