Qwen3-TTS リリースノート:オープンソースの音声デザイン、クローン、生成
QwenはQwen3-TTSファミリーをオープンソース化しました。このシリーズは高忠実度の音声クローン、自然言語ベースの音声デザイン、そして精密な音響制御が可能な音声生成モデルです。0.6B と 1.7B のパラメータサイズで提供され、10 の主要言語とさまざまな方言をサポートし、リアルタイムインタラクティブ音声アプリケーション向けの多用途ツールキットを提供します。
技術アーキテクチャと主要イノベーション
Qwen3-TTSは離散的なマルチコードブック言語モデル(LM)アーキテクチャを利用し、全情報のエンドツーエンド音声モデリングを実現します。このアプローチにより、従来の LM+DiT(Diffusion Transformer)方式でよく見られる情報ボトルネックや連鎖的エラーが排除されます。
Qwen3-TTS-Tokenizer-12Hz
本システムは Qwen3-TTS-Tokenizer-12Hz マルチコードブック音声エンコーダにより駆動されます。このトークナイザーは、パラ言語情報や音響環境特徴を保持しつつ、効率的な音響圧縮と高次元セマンティックモデリングを可能にします。その結果、軽量な非 DiT アーキテクチャで高速かつ高忠実度の音声再構築が実現できます。
デュアルトラック ストリーミング生成
リアルタイムインタラクションの要求に応えるため、Qwen3-TTSはデュアルトラックハイブリッドストリーミング生成アーキテクチャを実装しています。これにより、単一モデルでストリーミングと非ストリーミングの両方の生成をサポートし、1文字の処理だけで最初の音声パケットを配信します。エンドツーエンド合成レイテンシは最小で 97ms です。
モデルバリエーションと機能
| モデル | 主な特徴 | 言語サポート | ストリーミング | 指示制御 |
|---|---|---|---|---|
| Qwen3-TTS-12Hz-1.7B-VoiceDesign | 自然言語記述による音声デザイン | 10言語 | はい | はい |
| Qwen3-TTS-12Hz-1.7B-CustomVoice | 対象音色のスタイル制御;9つのプレミアム音色 | 10言語 | はい | はい |
| Qwen3-TTS-12Hz-1.7B-Base | 3秒の高速音声クローン;ファインチューニング用ベース | 10言語 | はい | いいえ |
| Qwen3-TTS-12Hz-0.6B-CustomVoice | 9つのプレミアム音色 | 10言語 | はい | いいえ |
| Qwen3-TTS-12Hz-0.6B-Base | 3秒の高速音声クローン;ファインチューニング用ベース | 10言語 | はい | いいえ |
サポートされている言語は中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語、ポルトガル語、スペイン語、イタリア語です。
主な機能
自然言語音声デザイン
ユーザーは自由形式の自然言語記述を提供することで、全く新しい音声アイデンティティを作成できます。これには音響属性(ピッチ、速度、音量)、人格の記述、背景情報の指定が含まれます。モデルはこれらの指示とテキストの意味に基づき、トーン、リズム、感情表現を適応させます。
高速音声クローンとクロスリンガル汎化
Baseモデルはわずか3秒の音声サンプルで高速音声クローンを実行できます。この機能はクロスリンガルクローンにも拡張され、話者の音色を異なる言語でも維持できます。
精密な音響制御
Qwen3-TTSは音声出力に対する多次元制御をサポートします。具体的には:
- 単一属性制御: 感情(例:「とても怒っている」)や速度(例:「極めて遅い」)など、特定の要素を調整します。
- 複数属性制御: 性別、ピッチ、速度、人格特性などを組み合わせた複雑なプロンプトを作成します。
- 音色再利用: 特定の音色を保存・呼び出し、複数キャラクターの長文対話を生成できます。
パフォーマンスベンチマーク
音声デザインと制御
InstructTTS-Eval ベンチマークにおいて、Qwen3-TTS-VoiceDesign はクローズドソースの MiniMax-Voice-Design モデルを指示遵守性と生成表現力の両面で上回りました。音声制御タスクでは、Qwen3-TTS-Instruct が InstructTTS-Eval で 75.4% のスコアを取得し、単一話者の多言語汎化において Word Error Rate (WER) が 2.34% でした。
音声クローン
Seed-tts-eval ベンチマークで、Qwen3-TTS は中国語と英語のクローンにおいて MiniMax と SeedTTS を上回る音声安定性を示しました。10言語のマルチリンガルテストセットでは、平均 WER が 1.835%、話者類似度が 0.789 で、MiniMax と ElevenLabs を凌駕しました。
トークナイザー品質
LibriSpeech test-clean セットで評価したところ、Qwen-TTS-Tokenizer は複数指標で SOTA 結果を達成しました:
- PESQ: 3.21(ワイドバンド)および 3.68(ナローバンド)。
- STOI: 0.96
- UTMOS: 4.16
- 話者類似度: 0.95