Qwen3-TTS 发布说明:开源语音设计、克隆与生成

Qwen 已开源 Qwen3-TTS 系列,这是一套能够实现高保真语音克隆、基于自然语言的语音设计以及精确声学控制的语音生成模型。模型提供 0.6B 与 1.7B 参数规模,支持 10 种主流语言及多种方言,为实时交互式语音应用提供了多功能工具箱。

技术架构与核心创新

Qwen3-TTS 采用离散多码本语言模型(LM)架构,实现全信息端到端语音建模。该方法消除了传统 LM+DiT(扩散 Transformer)方案中常见的信息瓶颈和级联错误。

Qwen3-TTS-Tokenizer-12Hz

系统由 Qwen3-TTS-Tokenizer-12Hz 多码本语音编码器提供动力。该分词器实现高效的声学压缩和高维语义建模,同时保留副语言信息和声学环境特征。它使得在轻量级非 DiT 架构下实现高速、高保真语音重建成为可能。

双轨流式生成

为满足实时交互的需求,Qwen3-TTS 实现了双轨混合流式生成架构。该架构使单一模型同时支持流式和非流式生成,并在处理仅一个字符后即可输出首个音频包。端到端合成延迟低至 97ms。

模型变体与能力

模型 关键特性 语言支持 流式 指令控制
Qwen3-TTS-12Hz-1.7B-VoiceDesign 通过自然语言描述进行语音设计 10 种语言
Qwen3-TTS-12Hz-1.7B-CustomVoice 对目标音色进行风格控制;9 种高品质音色 10 种语言
Qwen3-TTS-12Hz-1.7B-Base 3 秒快速语音克隆;用于微调的基础模型 10 种语言
Qwen3-TTS-12Hz-0.6B-CustomVoice 9 种高品质音色 10 种语言
Qwen3-TTS-12Hz-0.6B-Base 3 秒快速语音克隆;用于微调的基础模型 10 种语言

支持的语言包括中文、英文、日文、韩文、德文、法文、俄文、葡萄牙文、西班牙文和意大利文。

关键功能特性

基于自然语言的语音设计

用户可以通过自由形式的自然语言描述创建全新的语音身份。这包括指定声学属性(音高、速度、音量)、人物设定和背景信息。模型能够根据这些指令以及文本语义调整语调、节奏和情感表达。

快速语音克隆与跨语言泛化

Base 模型仅使用 3 秒音频样本即可实现快速语音克隆。该能力还支持跨语言克隆,使说话人的音色在不同语言间保持一致。

精确声学控制

Qwen3-TTS 支持对语音输出进行多维度控制,包括:

  • 单属性控制: 调整特定要素,如情感(例如“非常愤怒”)或语速(例如“极慢”)。
  • 多属性控制: 将性别、音高、速度和人格特征等组合成复杂提示。
  • 音色复用: 能够存储并调用特定音色,以生成多角色、长篇对话。

性能基准

语音设计与控制

在 InstructTTS-Eval 基准测试中,Qwen3-TTS-VoiceDesign 在指令遵循度和生成表现力方面均优于闭源的 MiniMax-Voice-Design 模型。语音控制任务中,Qwen3-TTS-Instruct 在 InstructTTS-Eval 上取得 75.4% 的得分,并在单说话人多语言泛化中保持 2.34% 的词错误率(WER)。

语音克隆

在 Seed-tts-eval 基准测试中,Qwen3-TTS 在中文和英文克隆的语音稳定性方面超越了 MiniMax 和 SeedTTS。于 10 语言多语言测试集上,平均 WER 为 1.835%,说话人相似度为 0.789,优于 MiniMax 与 ElevenLabs。

分词器质量

在 LibriSpeech test-clean 数据集上评估,Qwen-TTS-Tokenizer 在多项指标上取得了 SOTA 成绩:

  • PESQ: 3.21(宽带)和 3.68(窄带)。
  • STOI: 0.96
  • UTMOS: 4.16
  • 说话人相似度: 0.95

Sources