Stability-AI/stable-codec

A family of state-of-the-art Transformer-based audio codecs for low-bitrate high-quality audio coding.

解決的問題

提供一種高品質的語音編碼系統,能在保持高重建品質的同時,將音訊壓縮為低比特率的離散標記。特別解決了語音合成(TTS)等下游任務所需的高效音訊表示需求。

工作原理

該系統採用基於 Transformer 的架構,結合滑動視窗注意力機制,將音訊編碼為潛在變數與標記。使用有限標量量化(FSQ)瓶頸對音訊進行離散化。為提升標記在下游 AI 任務中的可用性,模型可透過連接主義時序分類(CTC)頭進行微調,從潛在變數中回歸出強制對齊的音素標籤。

適用對象

從事語音合成、音訊壓縮與生成式音訊模型的研究人員與開發者,需要一種高效方式將語音表示為離散標記。

主要亮點

  • 靈活的比特率控制:支援訓練後調整瓶頸設定,可變更標記字典大小與每秒比特數(bps)。
  • 面向下游任務優化stable-codec-speech-16k 變體經過專門微調,以增強潛在語義,提升 TTS 應用效能。
  • 高效推理:利用 FlashAttention 優化滑動視窗注意力的處理效率。
  • 全面的訓練工具:包含微調腳本,並支援 CTC 損失以整合音素級對齊。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案