Qwen3-TTS 版本說明:開源語音設計、克隆與生成
Qwen 已開源 Qwen3-TTS 系列,這是一套能夠實現高保真語音克隆、以自然語言進行語音設計以及精確聲學控制的語音生成模型。提供 0.6B 與 1.7B 兩種參數規模,這些模型支援 10 種主流語言及多種方言,為即時互動語音應用提供多功能工具箱。
技術架構與核心創新
Qwen3-TTS 採用離散多碼本語言模型(LM)架構,以實現全資訊端到端語音建模。此方法消除傳統 LM+DiT(Diffusion Transformer)方案中常見的資訊瓶頸與級聯錯誤。
Qwen3-TTS-Tokenizer-12Hz
系統由 Qwen3-TTS-Tokenizer-12Hz 多碼本語音編碼器提供動力。此 tokenizer 能夠在保留副語言資訊與聲學環境特徵的同時,實現高效的聲學壓縮與高維語意建模。這使得在輕量化非 DiT 架構下,能夠進行高速且高保真的語音重建。
雙軌串流生成
為滿足即時互動需求,Qwen3-TTS 實作雙軌混合串流生成架構。此架構使單一模型同時支援串流與非串流生成,僅在處理單一字元後即可傳送第一個音訊封包。端到端合成延遲低至 97ms。
模型變體與功能
Qwen3-TTS 系列分為兩種主要規模:1.7B 模型提供最高效能與控制,0.6B 模型則強調效率。
| 模型 | 主要特徵 | 語言支援 | 串流 | 指令控制 |
|---|---|---|---|---|
| Qwen3-TTS-12Hz-1.7B-VoiceDesign | 透過自然語言描述進行語音設計 | 10 種語言 | 是 | 是 |
| Qwen3-TTS-12Hz-1.7B-CustomVoice | 目標音色的風格控制;9 種高級音色 | 10 種語言 | 是 | 是 |
| Qwen3-TTS-12Hz-1.7B-Base | 3 秒快速語音克隆;作為微調的基礎 | 10 種語言 | 是 | 否 |
| Qwen3-TTS-12Hz-0.6B-CustomVoice | 9 種高級音色 | 10 種語言 | 是 | 否 |
| Qwen3-TTS-12Hz-0.6B-Base | 3 秒快速語音克隆;作為微調的基礎 | 10 種語言 | 是 | 否 |
支援的語言包括中文、英文、日文、韓文、德文、法文、俄文、葡萄牙文、西班牙文與義大利文。
主要功能特性
自然語言語音設計
使用者可透過自由形式的自然語言描述,創建全新語音身份。這包括指定聲學屬性(音高、速度、音量)、人物描述與背景資訊。模型會根據這些指示與文字語意,調整語調、節奏與情感表達。
快速語音克隆與跨語言泛化
Base 模型僅需 3 秒音訊樣本即可執行快速語音克隆。此功能亦支援跨語言克隆,讓說話者的音色在不同語言間保持一致。
精確聲學控制
Qwen3-TTS 支援對語音輸出的多維度控制,包括:
- Single Attribute Control: 調整特定元素,如情緒(例如「非常生氣」)或語速(例如「極度緩慢」)。
- Multi-Attribute Control: 將性別、音高、速度與個性特徵結合成複雜提示。
- Timbre Reuse: 能夠儲存與呼叫特定音色,以產生多角色、長篇對話。
效能基準
語音設計與控制
在 InstructTTS-Eval 基準測試中,Qwen3-TTS-VoiceDesign 在指令遵循度與生成表現力方面均優於封閉源的 MiniMax-Voice-Design 模型。於語音控制任務上,Qwen3-TTS-Instruct 在 InstructTTS-Eval 獲得 75.4% 的分數,且在單說話者多語言泛化的字詞錯誤率(WER)維持在 2.34%。
語音克隆
在 Seed-tts-eval 基準測試中,Qwen3-TTS 在中文與英文克隆的語音穩定性上超越 MiniMax 與 SeedTTS。於 10 種語言的多語言測試集上,取得平均 WER 1.835% 與說話者相似度 0.789,優於 MiniMax 與 ElevenLabs。
Tokenizer 品質
在 LibriSpeech test-clean 集上評估,Qwen-TTS-Tokenizer 在多項指標上達到 SOTA 結果:
- PESQ: 3.21(寬頻)與 3.68(窄頻)。
- STOI: 0.96
- UTMOS: 4.16
- Speaker Similarity: 0.95