Qwen-TTS 更新:支持中文方言和双语合成
Qwen 已推出其文本转语音模型 Qwen-TTS (qwen-tts-latest 或 qwen-tts-2025-05-22) 的更新,使语音生成达到人类水平的自然度和表现力。此更新尤为突出的是它能够合成三种特定的中文方言——北京话、上海话和四川话,并支持中英双语声音。
方言支持与语音选项
Qwen-TTS 现在支持生成三种中文方言,使模型能够捕捉地区语音模式和自然的语调变化。可用的语音按方言或双语能力分类如下:
- 北京话: Dylan
- 上海话: Jada
- 四川话: Sunny
- 双语(中英): Cherry, Ethan, Chelsie, and Serena
总计有七个中英双语语音可用,实验室表示未来将计划推出更多语言和风格选项。
技术能力与性能
Qwen-TTS 在包含数百万小时语音的大规模数据集上进行训练。该训练使模型能够根据输入文本自动调整韵律、节奏和情感语调,从而实现高度的自然度。
性能基准
使用 SeedTTS-Eval 基准对模型性能进行评估。双语说话人的结果如下:
| 说话人 | 词错误率 (中文) | 词错误率 (英文) | 词错误率 (困难) | 相似度 (中文) | 相似度 (英文) | 相似度 (困难) |
|---|---|---|---|---|---|---|
| Chelsie | 1.256 | 2.004 | 6.171 | 0.658 | 0.473 | 0.662 |
| Serena | 1.495 | 2.206 | 7.394 | 0.804 | 0.508 | 0.803 |
| Ethan | 1.489 | 1.969 | 6.754 | 0.777 | 0.558 | 0.779 |
| Cherry | 1.209 | 1.967 | 6.069 | 0.799 | 0.664 | 0.801 |
API 集成
Qwen-TTS 可通过 Qwen API 使用。开发者可以使用 dashscope Python 库集成该模型。合成过程包括调用 SpeechSynthesizer.call 方法,指定模型(例如 qwen-tts-latest)、目标文本以及所选语音。
import os
import requests
import dashscope
def synthesize_speech(text, voice="Dylan", model="qwen-tts-latest"):
api_key = os.getenv("DASHSCOPE_API_KEY")
response = dashscope.audio.qwen_tts.SpeechSynthesizer.call(
model=model,
api_key=api_key,
text=text,
voice=voice,
)
return response.output.audio["url"]