Qwen3-TTS-Flash 更新:49 种音色、10 种语言和 9 种方言

Qwen 发布了 Qwen3-TTS-Flash 的更新,这是一款旗舰级文本转语音(TTS)模型,旨在实现跨多种音色、语言和方言的自然且富有表现力的语音合成。此次更新显著扩展了模型的声音多样性和语言覆盖范围,并通过 Qwen API 提供。

扩展的音色和角色支持

Qwen3-TTS-Flash 现在提供超过 49 种高质量音色。这些声音涵盖了广泛的性别、年龄、地区特征和角色设定,以满足各种应用场景。具体角色设定包括:

  • Momo:活泼且古怪
  • Ono Anna:温暖且支持的童年朋友
  • Vivian:自豪且直率的“硬妹子”
  • Elias:严格的教官
  • Eldric Sage:睿智的长者
  • Bunny:可爱的萝莉

多语言和多方言能力

全球语言支持

该模型支持 10 种主要语言:中文、英文、德文、意大利文、葡萄牙文、西班牙文、日文、韩文、法文和俄文。在使用 MiniMax TTS 多语言测试集进行性能基准测试时,Qwen3-TTS-Flash 的平均词错误率(WER)低于 GPT-4o-Audio-Preview、ElevenLabs 和 MiniMax。

中文方言合成

Qwen3-TTS-Flash 为九种中文方言提供了本地口音和语言细微差别的真实再现:

  • 普通话
  • 闽南语
  • 吴语
  • 粤语
  • 四川话
  • 北京话
  • 南京话
  • 天津话
  • 陕西话

韵律和人类相似度的改进

Qwen3-TTS-Flash 具备基于提供的文本输入对语速和韵律进行增强自适应调节的特性。相较于之前的版本,这些改进使得语音在节奏和语调上更接近真实的人类对话。

技术实现与 API 使用

开发者可以通过 DashScope SDK 使用模型标识符 qwen3-tts-flash-2025-11-27 访问该模型。API 允许用户指定 voice(音色)和 language_type,以确保正确的发音和自然的语调。

import dashscope

response = dashscope.MultiModalConversation.call(
    model="qwen3-tts-flash-2025-11-27",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    text=text,
    voice="Ryan",
    language_type="English",
    stream=False
)

Sources