Qwen3-TTS-Flash 更新:49 种音色、10 种语言和 9 种方言
Qwen 发布了 Qwen3-TTS-Flash 的更新,这是一款旗舰级文本转语音(TTS)模型,旨在实现跨多种音色、语言和方言的自然且富有表现力的语音合成。此次更新显著扩展了模型的声音多样性和语言覆盖范围,并通过 Qwen API 提供。
扩展的音色和角色支持
Qwen3-TTS-Flash 现在提供超过 49 种高质量音色。这些声音涵盖了广泛的性别、年龄、地区特征和角色设定,以满足各种应用场景。具体角色设定包括:
- Momo:活泼且古怪
- Ono Anna:温暖且支持的童年朋友
- Vivian:自豪且直率的“硬妹子”
- Elias:严格的教官
- Eldric Sage:睿智的长者
- Bunny:可爱的萝莉
多语言和多方言能力
全球语言支持
该模型支持 10 种主要语言:中文、英文、德文、意大利文、葡萄牙文、西班牙文、日文、韩文、法文和俄文。在使用 MiniMax TTS 多语言测试集进行性能基准测试时,Qwen3-TTS-Flash 的平均词错误率(WER)低于 GPT-4o-Audio-Preview、ElevenLabs 和 MiniMax。
中文方言合成
Qwen3-TTS-Flash 为九种中文方言提供了本地口音和语言细微差别的真实再现:
- 普通话
- 闽南语
- 吴语
- 粤语
- 四川话
- 北京话
- 南京话
- 天津话
- 陕西话
韵律和人类相似度的改进
Qwen3-TTS-Flash 具备基于提供的文本输入对语速和韵律进行增强自适应调节的特性。相较于之前的版本,这些改进使得语音在节奏和语调上更接近真实的人类对话。
技术实现与 API 使用
开发者可以通过 DashScope SDK 使用模型标识符 qwen3-tts-flash-2025-11-27 访问该模型。API 允许用户指定 voice(音色)和 language_type,以确保正确的发音和自然的语调。
import dashscope
response = dashscope.MultiModalConversation.call(
model="qwen3-tts-flash-2025-11-27",
api_key=os.getenv("DASHSCOPE_API_KEY"),
text=text,
voice="Ryan",
language_type="English",
stream=False
)