Qwen3-TTS-Flash アップデート:49 の音色、10 の言語、9 の方言

Qwen は、複数の音色、言語、方言にわたる自然で表現力豊かな音声合成を実現するフラッグシップのテキスト音声合成(TTS)モデルである Qwen3-TTS-Flash のアップデートをリリースしました。このアップデートにより、モデルの音声多様性と語彙的範囲が大幅に拡大され、Qwen API で利用可能になりました。

拡張された音色とペルソナのサポート

Qwen3-TTS-Flash は現在、49 以上の高品質な音色を提供しています。これらの音声は、性別、年齢、地域的特徴、キャラクタープロフィールの幅広いスペクトルをカバーし、さまざまな利用シーンに適合します。具体的なキャラクターペルソナは以下の通りです:

  • Momo:遊び心があり、風変わり
  • Ono Anna:温かく支えてくれる幼馴染
  • Vivian:誇り高く率直な「タフな女の子」
  • Elias:厳格な指導者
  • Eldric Sage:賢明な長老
  • Bunny:かわいいロリ

多言語・多方言対応機能

グローバル言語サポート

このモデルは、中文、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語の 10 の主要言語をサポートしています。MiniMax TTS 多言語テストセットを使用した性能ベンチマークにおいて、Qwen3-TTS-Flash は GPT-4o-Audio-Preview、ElevenLabs、MiniMax よりも低い平均語彙誤り率 (WER) を達成しました。

中国語方言合成

Qwen3-TTS-Flash は、9 つの中国語方言に対して、現地アクセントと語彙のニュアンスを忠実に再現します。

  • 普通話(Mandarin)
  • 福建語(Hokkien)
  • 呉語(Wu)
  • 広東語(Cantonese)
  • 四川語(Sichuanese)
  • 北京語(Beijing)
  • 南京語(Nanjing)
  • 天津語(Tianjin)
  • 陝西語(Shaanxi)

プロソディと人間らしさの改善

Qwen3-TTS-Flash は、提供されたテキスト入力に基づく話速とプロソディの適応的調整を強化しています。従来バージョンと比較して、これらの改善によりリズムとイントネーションの面で実際の人間の会話により近い音声が得られます。

技術的実装と API の使用方法

開発者は qwen3-tts-flash-2025-11-27 モデル識別子を使用して DashScope SDK 経由でモデルにアクセスできます。API では voice(音色)と language_type を指定して、正しい発音と自然なイントネーションを実現できます。

import dashscope

response = dashscope.MultiModalConversation.call(
    model="qwen3-tts-flash-2025-11-27",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    text=text,
    voice="Ryan",
    language_type="English",
    stream=False
)

Sources