Qwen-TTS 更新:支持中文方言和双语合成

Qwen 已推出其文本转语音模型 Qwen-TTS (qwen-tts-latestqwen-tts-2025-05-22) 的更新,使语音生成达到人类水平的自然度和表现力。此更新尤为突出的是它能够合成三种特定的中文方言——北京话、上海话和四川话,并支持中英双语声音。

方言支持与语音选项

Qwen-TTS 现在支持生成三种中文方言,使模型能够捕捉地区语音模式和自然的语调变化。可用的语音按方言或双语能力分类如下:

  • 北京话: Dylan
  • 上海话: Jada
  • 四川话: Sunny
  • 双语(中英): Cherry, Ethan, Chelsie, and Serena

总计有七个中英双语语音可用,实验室表示未来将计划推出更多语言和风格选项。

技术能力与性能

Qwen-TTS 在包含数百万小时语音的大规模数据集上进行训练。该训练使模型能够根据输入文本自动调整韵律、节奏和情感语调,从而实现高度的自然度。

性能基准

使用 SeedTTS-Eval 基准对模型性能进行评估。双语说话人的结果如下:

说话人 词错误率 (中文) 词错误率 (英文) 词错误率 (困难) 相似度 (中文) 相似度 (英文) 相似度 (困难)
Chelsie 1.256 2.004 6.171 0.658 0.473 0.662
Serena 1.495 2.206 7.394 0.804 0.508 0.803
Ethan 1.489 1.969 6.754 0.777 0.558 0.779
Cherry 1.209 1.967 6.069 0.799 0.664 0.801

API 集成

Qwen-TTS 可通过 Qwen API 使用。开发者可以使用 dashscope Python 库集成该模型。合成过程包括调用 SpeechSynthesizer.call 方法,指定模型(例如 qwen-tts-latest)、目标文本以及所选语音。

import os
import requests
import dashscope

def synthesize_speech(text, voice="Dylan", model="qwen-tts-latest"):
    api_key = os.getenv("DASHSCOPE_API_KEY")
    response = dashscope.audio.qwen_tts.SpeechSynthesizer.call(
        model=model,
        api_key=api_key,
        text=text,
        voice=voice,
    )
    return response.output.audio["url"]

Sources