breezeblue-ai/breeze-tts
Official PyTorch inference for Breeze TTS 2
解決的問題
Breeze TTS 2 專為即時、富有表現力的文字轉語音(TTS)互動而設計。它滿足了透過自然語言指令精確控制的高品質、低延遲音訊生成需求,讓使用者無需大量技術設定或多個參考樣本即可建立或修改語音。
運作方式
此模型是一個雙語(英語和中文)開放權重系統,支援三種主要操作模式:
- 語音克隆:使用參考音訊片段及其轉錄文字來複製說話者的音色和風格。
- 語音設計:僅基於自然語言描述(例如,「一個溫暖、體貼的年輕女性」)生成全新的語音。
- 語音導向:將參考音訊與特定指令結合,以引導克隆語音的語調、情感和節奏。
它也支援使用括號或方括號直接插入文字中的「發聲事件」(如大笑或嘆氣)。為了實現超低延遲,它利用帶有 CUDA 圖和專用解碼階段的「快速路徑」來最小化首次音訊時間(TTFA)。
適用對象
此專案面向建置即時 AI 語音代理、互動式應用程式的開發者和研究人員,以及需要在英語和中文中精確控制語音表達和情感的內容創作者。
亮點
- 指令遵循:支援使用自然語言進行無參考語音設計和有參考語音導向。
- 超低延遲:在 NVIDIA H100 GPU 上實現低於 40 毫秒的首次音訊時間(TTFA)。
- 雙語支援:單一模型自然處理英語和中文語音。
- 表現力控制:允許插入諸如
(laugh)或(sigh)之類的內聯發聲事件,以實現更人性化的表達。 - GPU 效率:在 eager 推論時約使用 7.7 GiB 的 GPU 記憶體。
相關
- 專案
- 專案
- 專案
- 專案