Qwen3-TTS-Flash 更新:49 種音色、10 種語言與 9 種方言
Qwen 已發布 Qwen3-TTS-Flash 的更新,這是一款旗艦級文字轉語音(TTS)模型,旨在於多種音色、語言與方言之間實現自然且富有表情的語音合成。此更新大幅擴展了模型的聲音多樣性與語言覆蓋,並透過 Qwen API 提供使用。
擴充的音色與角色支援
Qwen3-TTS-Flash 現在提供超過 49 種高品質音色。這些聲音涵蓋廣泛的性別、年齡、地域特徵與角色設定,以符合各種應用情境。具體的角色人物包括:
- Momo:活潑且古怪
- Ono Anna:溫暖且支持的童年好友
- Vivian:驕傲且直率的「硬妹」
- Elias:嚴格的教官
- Eldric Sage:智慧的長者
- Bunny:可愛的蘿莉
多語言與多方言能力
全球語言支援
模型支援 10 種主要語言:中文、英文、德文、義大利文、葡萄牙文、西班牙文、日文、韓文、法文與俄文。於使用 MiniMax TTS 多語言測試集進行效能基準測試時,Qwen3-TTS-Flash 的平均字錯誤率(WER)低於 GPT-4o-Audio-Preview、ElevenLabs 與 MiniMax。
中文方言合成
Qwen3-TTS-Flash 為九種中文方言提供真實的地方口音與語言細微差異再現:
- 官話
- 閩南語
- 吳語
- 粵語
- 四川話
- 北京話
- 南京話
- 天津話
- 陝西話
韻律與擬人化的改進
Qwen3-TTS-Flash 具備根據提供的文字輸入進行語速與韻律的增強自適應調整。相較於先前版本,這些改進使語音在節奏與語調上更貼近真實的人類對話。
技術實作與 API 使用方式
開發者可透過 DashScope SDK 使用模型識別碼 qwen3-tts-flash-2025-11-27 來存取此模型。API 允許使用者指定 voice(音色)與 language_type,以確保正確的發音與自然的語調。
import dashscope
response = dashscope.MultiModalConversation.call(
model="qwen3-tts-flash-2025-11-27",
api_key=os.getenv("DASHSCOPE_API_KEY"),
text=text,
voice="Ryan",
language_type="English",
stream=False
)