Inflect-Micro-v2 发布说明

Inflect-Micro-v2 发布说明

Inflect-Micro-v2 是一个本地文本到波形语音合成系统,仅用 9,356,513 个参数(FP32 下 37.53 MB)即可提供高质量的英文 TTS。它专为资源受限环境设计,在这些环境中低延迟和小内存占用至关重要。

性能与评估

Inflect-Micro-v2 优先考虑自然度与效率的平衡,在人类偏好和可理解性方面优于几种紧凑型 TTS 基线。

人类偏好与自然度

在一次匿名社区研究中,Inflect-Micro-v2 获得了 66.2% 的偏好率(21 胜,10 负,3 平)。就预测自然度而言,该模型在 UTMOS22 量表上得分为 4.395,这是一个人类平均意见得分(MOS)的学习预测器。

可理解性

使用两个 ASR 的语义词错误率(WER)共识(Qwen3-ASR 和 Nemotron 3.5),模型记录了 3.99% 的语义 WER。各个 ASR 结果包括:

  • Qwen3-ASR: 2.52%
  • Nemotron 3.5: 5.45%
  • Whisper large-v3: 2.73%

CPU 运行时间和吞吐量

Inflect-Micro-v2 在 CPU 上合成语音的速度显著快于实时。在受控参考运行(8 vCPU,32 GB RAM,四个框架线程)中,它实现了 6.28× 实时吞吐量(稳态 RTF 为 0.1593)。

技术架构

Inflect-Micro-v2 基于 VITS 家族的端到端文本到波形生成器。其架构包括英文音素前端、单调对齐、随机潜在合成、残差耦合流以及集成的抗混叠神经波形解码器。

参数预算与配置

组件 规格
潜在通道 192
文本隐藏通道 96
编码器层数 / 头数 3 / 2
前馈通道 768
流耦合块 4
初始解码器通道 320
上采样率 8, 8, 2, 2
输出 24 kHz 单声道波形

部署与本地执行

该模型同时支持 CPU 和 CUDA 推理,并提供专用的 ONNX 运行时,以便在无法使用 PyTorch 的环境中使用。

PyTorch 安装与使用

用户可以通过 Hugging Face Hub 安装该模型:

python -m pip install --upgrade huggingface_hub
hf download owensong/Inflect-Micro-v2 --local-dir Inflect-Micro-v2
cd Inflect-Micro-v2
python -m pip install -r requirements.txt

基本的 Python 合成:

from inference import InflectTTS

tts = InflectTTS(\ 		self, device="cpu	ts.save(
    "A small voice can still have something meaningful to say."\ 		"sample.wav",
    speed=1.0,
    variation=0.667,
    seed=7,
)

ONNX 运行时

官方的 FP32 导出可作为 Inflect-Micro-v2-ONNX 获得。此版本在不需要 PyTorch 的情况下支持动态长度和提供程序选择(CPU/CUDA/DirectML)。神经模型被拆分为两个图:duration.onnxdecode.onnx

控件与长文本处理

Inflect-Micro-v2 使用感知标点的分割来处理长段落,将文本分割成块,并通过受控的停顿和边缘淡入淡出将其连接起来以保持稳定性。

合成控制

控制 默认值 范围 效果
speed 1.0 0.5–2.0 调整播放速度
variation 0.667 0.0–1.0 控制潜在变化(值越低越平稳)
seed 0 Integer 确保在相同运行时栈上输出可重复

局限性与范围

Inflect-Micro-v2 是一个以推理为首要的发布版本,具有特定的约束:

  • 语言和声音: 它仅限于英文,并且具有一个固定的男声。它不支持零样本声音克隆。
  • 稳定性: 不熟悉的表达可能导致表达更平淡或不够稳定。
  • 适应: 新声音和新语言的适应目前尚未得到验证或支持。

社区反馈

虽然用户们称赞了该模型相对于其规模的质量,但有些用户指出,音调变化偶尔会显得不自然:

"音调变化很奇怪,但这听起来不像机器人。不错!"

其他用户强调了该模型的效率,一位开发者通过 inflect-speechd 实现了服务器集成,以替换更大的 ONNX 模型。

SUMMARY: Inflect-Micro-v2 是一个参数高效的本地文本到波形 TTS 模型,在不到 1000 万参数的情况下提供高质量的英文语音合成。

TITLE: Inflect-Micro-v2 发布说明

Sources