neuphonic/neutts

On-device TTS model by Neuphonic

解決的問題

NeuTTS 旨在將高品質文本轉語音 (TTS) 從雲端 API 遷移到本地裝置。它提供了一套輕量級、聽感自然的語音模型,可以在手機、筆記型電腦和 Raspberry Pi 等嵌入式裝置上執行,無需持續的網路連接,從而確保更好的隱私保護與更低的延遲。

工作原理

該系統結合使用了小型 LLM 主幹網路(針對文本理解進行了優化)與名為 NeuCodec 的神經音訊編解碼器。這種架構允許模型處理文本並生成音訊 Token,隨後由編解碼器將其轉換為可聽語音。它支援即時語音克隆,只需使用短促(3-15 秒)的音訊樣本及其對應的文本作為參考,即可模仿特定聲音。

適用對象

專為開發嵌入式語音代理、本地 AI 助手、智慧玩具以及對端側處理有嚴格要求的合規安全應用而構建。

亮點

  • 端側優化:提供 GGUF 量化,以便在行動與嵌入式硬體上進行高效推理。
  • 即時語音克隆:能夠使用僅 3 秒的音訊進行聲音克隆。
  • 多語言支援:提供英語、西班牙語、德語和法語模型。
  • 情感控制:NeuTTS-2E 模型允許為固定說話人實現特定的情感表達(例如:快樂、悲傷、憤怒)。
  • 即時效能:能夠在主流配置裝置上實現即時生成。
  • 內建安全性:在生成的音訊中包含感知閾值浮水印,以防止濫用。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案