Qwen‑TTS 更新:支援中文方言與雙語合成
Qwen 為其文字轉語音模型 Qwen-TTS(qwen-tts-latest 或 qwen-tts-2025-05-22)推出了更新,使語音生成達到與人類相當的自然度與表現力。此更新特別值得關注的是,它能合成三種中文方言——北京話、上海話與四川話,並支援中英雙語語音。
方言支援與語音選項
Qwen‑TTS 現在支援生成三種中文方言,讓模型能捕捉區域語音特徵與自然語調。可用的語音依其方言或雙語能力分類:
- 北京話: Dylan
- 上海話: Jada
- 四川話: Sunny
- 雙語(中英): Cherry、Ethan、Chelsie 與 Serena
總計有七種中英雙語語音可供使用,實驗室表示未來將推出更多語言與風格選項。
技術能力與效能
Qwen‑TTS 以包含數百萬小時語音的大規模資料集進行訓練。此訓練使模型能根據輸入文字自動調整韻律、節奏與情感語調,達到高度自然的表現。
效能基準
模型的效能使用 SeedTTS‑Eval 基準進行評估。雙語說話者的結果如下:
| 說話者 | WER(中文) | WER(英文) | WER(困難) | SIM(中文) | SIM(英文) | SIM(困難) |
|---|---|---|---|---|---|---|
| Chelsie | 1.256 | 2.004 | 6.171 | 0.658 | 0.473 | 0.662 |
| Serena | 1.495 | 2.206 | 7.394 | 0.804 | 0.508 | 0.803 |
| Ethan | 1.489 | 1.969 | 6.754 | 0.777 | 0.558 | 0.779 |
| Cherry | 1.209 | 1.967 | 6.069 | 0.799 | 0.664 | 0.801 |
API 整合
Qwen‑TTS 可透過 Qwen API 使用。開發者可使用 dashscope Python 套件將模型整合至應用程式。合成流程包括呼叫 SpeechSynthesizer.call 方法,指定模型(例如 qwen-tts-latest)、目標文字與選擇的語音。
import os
import requests
import dashscope
def synthesize_speech(text, voice="Dylan", model="qwen-tts-latest"):
api_key = os.getenv("DASHSCOPE_API_KEY")
response = dashscope.audio.qwen_tts.SpeechSynthesizer.call(
model=model,
api_key=api_key,
text=text,
voice=voice,
)
return response.output.audio["url"]