Inflect-Micro-v2 發布說明

Inflect-Micro-v2 發布說明

Inflect-Micro-v2 是一個本地文本到波形語音合成系統,僅需 9,356,513 個參數(FP32 下為 37.53 MB)即可提供高品質的英語 TTS。它專為資源受限環境設計,在該環境中低延遲和小記憶體佔用至關重要。

效能與評估

Inflect-Micro-v2 在自然度與效率之間取得平衡,在人類偏好和可理解性方面優於多個緊湊型 TTS 基線。

人類偏好與自然度

在一次匿名社區研究中,Inflect-Micro-v2 獲得 66.2% 的偏好率(21 勝、10 負、3 平)。就預測自然度而言,該模型在 UTMOS22 標準上得分為 4.395,這是一個學習得到的人類平均意見分數(MOS)預測器。

可理解性

使用兩個 ASR 語義詞錯誤率(WER)共識(Qwen3-ASR 和 Nemotron 3.5),該模型記錄了 3.99% 的語義 WER。各個 ASR 結果包括:

  • Qwen3-ASR: 2.52%
  • Nemotron 3.5: 5.45%
  • Whisper large-v3: 2.73%

CPU 執行時間與吞吐量

Inflect-Micro-v2 在 CPU 上合成語音的速度顯著快於實時。在受控參考運行中(8 vCPU、32 GB RAM、四個框架執行緒),它達到了 6.28× 實時吞吐量(穩態 RTF 為 0.1593)。

技術架構

Inflect-Micro-v2 基於 VITS-family 的端到端文本到波形生成器。其架構包括英語音素前端、單調對齊、隨機潛在合成、殘餘耦合流以及整合的抗混疊神經波形解碼器。

參數預算與配置

元件 規格
潛在通道 192
文本隱藏通道 96
編碼器層數 / 注意力頭數 3 / 2
前饋通道 768
流耦合塊 4
初始解碼器通道 320
上採樣率 8, 8, 2, 2
輸出 24 kHz 單聲道波形

部署與本地執行

該模型同時支援 CPU 與 CUDA 推論,並提供專用的 ONNX 執行環境,適用於無法使用 PyTorch 的環境。

PyTorch 安裝與使用

使用者可以透過 Hugging Face Hub 安裝模型:

python -m pip install --upgrade huggingface_hub
hf download owensong/Inflect-Micro-v2 --local-dir Inflect-Micro-v2
cd Inflect-Micro-v2
python -m pip install -r requirements.txt

基本的 Python 合成:

from inference import InflectTTS

tts = InflectTTS(\n    \"\", device=\"cpu\"\n)
tts.save(
    \"A small voice can still have something meaningful to say.\",
    \"sample.wav\",
    speed=1.0,
    variation=0.667,
    seed=7,
)

ONNX 執行環境

官方的 FP32 導出版本可作為 Inflect-Micro-v2-ONNX 取得。此版本在不需要 PyTorch 的情況下支援動態長度和提供者選擇(CPU/CUDA/DirectML)。神經模型被分割為兩個圖:duration.onnxdecode.onnx

控制與長文本處理

Inflect-Micro-v2 使用標點感知分割來處理長篇文本,將文本分割成塊,並透過受控停頓和邊緣淡化連接以保持穩定性。

合成控制

控制 預設值 範圍 效果
speed 1.0 0.5–2.0 調整播放速度
variation 0.667 0.0–1.0 控制潛在變異(較低時較穩定)
seed 0 Integer 確保在相同執行堆疊上可重複輸出

限制與範圍

Inflect-Micro-v2 是一個以推論為優先的發布版,具有特定限制:

  • 語言與聲音: 它僅限於英語,並具有一個固定的男性聲音。它不支援零樣本聲音克隆。
  • 穩定性: 不熟悉的表達可能導致較為平淡或不穩定的表達。
  • 適應: 新聲音和新語言的適應目前尚未驗證或支援。

社區回饋

雖然使用者讚揚了模型相對其大小的品質,但有些人指出其語調偶爾可能感覺不自然:

"這些語調很奇怪,但這不聽起來像機器人。不錯!"

其他使用者則強調了模型的效率,其中一位開發者透過 inflect-speechd 實現了伺服器整合,以取代較大的 ONNX 模型。

Sources