Inflect-Micro-v2 发布说明
Inflect-Micro-v2 发布说明
Inflect-Micro-v2 是一个本地文本到波形语音合成系统,仅用 9,356,513 个参数(FP32 下 37.53 MB)即可提供高质量的英文 TTS。它专为资源受限环境设计,在这些环境中低延迟和小内存占用至关重要。
性能与评估
Inflect-Micro-v2 优先考虑自然度与效率的平衡,在人类偏好和可理解性方面优于几种紧凑型 TTS 基线。
人类偏好与自然度
在一次匿名社区研究中,Inflect-Micro-v2 获得了 66.2% 的偏好率(21 胜,10 负,3 平)。就预测自然度而言,该模型在 UTMOS22 量表上得分为 4.395,这是一个人类平均意见得分(MOS)的学习预测器。
可理解性
使用两个 ASR 的语义词错误率(WER)共识(Qwen3-ASR 和 Nemotron 3.5),模型记录了 3.99% 的语义 WER。各个 ASR 结果包括:
- Qwen3-ASR: 2.52%
- Nemotron 3.5: 5.45%
- Whisper large-v3: 2.73%
CPU 运行时间和吞吐量
Inflect-Micro-v2 在 CPU 上合成语音的速度显著快于实时。在受控参考运行(8 vCPU,32 GB RAM,四个框架线程)中,它实现了 6.28× 实时吞吐量(稳态 RTF 为 0.1593)。
技术架构
Inflect-Micro-v2 基于 VITS 家族的端到端文本到波形生成器。其架构包括英文音素前端、单调对齐、随机潜在合成、残差耦合流以及集成的抗混叠神经波形解码器。
参数预算与配置
| 组件 | 规格 |
|---|---|
| 潜在通道 | 192 |
| 文本隐藏通道 | 96 |
| 编码器层数 / 头数 | 3 / 2 |
| 前馈通道 | 768 |
| 流耦合块 | 4 |
| 初始解码器通道 | 320 |
| 上采样率 | 8, 8, 2, 2 |
| 输出 | 24 kHz 单声道波形 |
部署与本地执行
该模型同时支持 CPU 和 CUDA 推理,并提供专用的 ONNX 运行时,以便在无法使用 PyTorch 的环境中使用。
PyTorch 安装与使用
用户可以通过 Hugging Face Hub 安装该模型:
python -m pip install --upgrade huggingface_hub
hf download owensong/Inflect-Micro-v2 --local-dir Inflect-Micro-v2
cd Inflect-Micro-v2
python -m pip install -r requirements.txt
基本的 Python 合成:
from inference import InflectTTS
tts = InflectTTS(\ self, device="cpu ts.save(
"A small voice can still have something meaningful to say."\ "sample.wav",
speed=1.0,
variation=0.667,
seed=7,
)
ONNX 运行时
官方的 FP32 导出可作为 Inflect-Micro-v2-ONNX 获得。此版本在不需要 PyTorch 的情况下支持动态长度和提供程序选择(CPU/CUDA/DirectML)。神经模型被拆分为两个图:duration.onnx 和 decode.onnx。
控件与长文本处理
Inflect-Micro-v2 使用感知标点的分割来处理长段落,将文本分割成块,并通过受控的停顿和边缘淡入淡出将其连接起来以保持稳定性。
合成控制
| 控制 | 默认值 | 范围 | 效果 |
|---|---|---|---|
speed |
1.0 | 0.5–2.0 | 调整播放速度 |
variation |
0.667 | 0.0–1.0 | 控制潜在变化(值越低越平稳) |
seed |
0 | Integer | 确保在相同运行时栈上输出可重复 |
局限性与范围
Inflect-Micro-v2 是一个以推理为首要的发布版本,具有特定的约束:
- 语言和声音: 它仅限于英文,并且具有一个固定的男声。它不支持零样本声音克隆。
- 稳定性: 不熟悉的表达可能导致表达更平淡或不够稳定。
- 适应: 新声音和新语言的适应目前尚未得到验证或支持。
社区反馈
虽然用户们称赞了该模型相对于其规模的质量,但有些用户指出,音调变化偶尔会显得不自然:
"音调变化很奇怪,但这听起来不像机器人。不错!"
其他用户强调了该模型的效率,一位开发者通过 inflect-speechd 实现了服务器集成,以替换更大的 ONNX 模型。
SUMMARY: Inflect-Micro-v2 是一个参数高效的本地文本到波形 TTS 模型,在不到 1000 万参数的情况下提供高质量的英文语音合成。
TITLE: Inflect-Micro-v2 发布说明