Qwen‑TTS 更新:支援中文方言與雙語合成

Qwen 為其文字轉語音模型 Qwen-TTSqwen-tts-latestqwen-tts-2025-05-22)推出了更新,使語音生成達到與人類相當的自然度與表現力。此更新特別值得關注的是,它能合成三種中文方言——北京話、上海話與四川話,並支援中英雙語語音。

方言支援與語音選項

Qwen‑TTS 現在支援生成三種中文方言,讓模型能捕捉區域語音特徵與自然語調。可用的語音依其方言或雙語能力分類:

  • 北京話: Dylan
  • 上海話: Jada
  • 四川話: Sunny
  • 雙語(中英): Cherry、Ethan、Chelsie 與 Serena

總計有七種中英雙語語音可供使用,實驗室表示未來將推出更多語言與風格選項。

技術能力與效能

Qwen‑TTS 以包含數百萬小時語音的大規模資料集進行訓練。此訓練使模型能根據輸入文字自動調整韻律、節奏與情感語調,達到高度自然的表現。

效能基準

模型的效能使用 SeedTTS‑Eval 基準進行評估。雙語說話者的結果如下:

說話者 WER(中文) WER(英文) WER(困難) SIM(中文) SIM(英文) SIM(困難)
Chelsie 1.256 2.004 6.171 0.658 0.473 0.662
Serena 1.495 2.206 7.394 0.804 0.508 0.803
Ethan 1.489 1.969 6.754 0.777 0.558 0.779
Cherry 1.209 1.967 6.069 0.799 0.664 0.801

API 整合

Qwen‑TTS 可透過 Qwen API 使用。開發者可使用 dashscope Python 套件將模型整合至應用程式。合成流程包括呼叫 SpeechSynthesizer.call 方法,指定模型(例如 qwen-tts-latest)、目標文字與選擇的語音。

import os
import requests
import dashscope

def synthesize_speech(text, voice="Dylan", model="qwen-tts-latest"):
    api_key = os.getenv("DASHSCOPE_API_KEY")
    response = dashscope.audio.qwen_tts.SpeechSynthesizer.call(
        model=model,
        api_key=api_key,
        text=text,
        voice=voice,
    )
    return response.output.audio["url"]

Sources