Stability-AI/stable-codec

A family of state-of-the-art Transformer-based audio codecs for low-bitrate high-quality audio coding.

解决的问题

提供一种高质量的语音编码系统,能够在保持高重建质量的同时,将音频压缩为低比特率的离散标记。它特别解决了语音合成(TTS)等下游任务所需的高效音频表示需求。

工作原理

该系统采用基于 Transformer 的架构,结合滑动窗口注意力机制,将音频编码为潜在变量和标记。使用有限标量量化(FSQ)瓶颈对音频进行离散化。为了提升标记在下游 AI 任务中的可用性,模型可通过连接时序分类(CTC)头进行微调,从潜在变量中回归出强制对齐的音素标签。

适用人群

从事语音合成、音频压缩和生成式音频模型的研究人员和开发者,需要一种高效方式将语音表示为离散标记。

主要亮点

  • 灵活的比特率控制:支持训练后调整瓶颈配置,可更改标记字典大小和每秒比特数(bps)。
  • 面向下游任务优化stable-codec-speech-16k 变体经过专门微调,以增强潜在语义,提升 TTS 应用性能。
  • 高效推理:利用 FlashAttention 优化滑动窗口注意力的处理效率。
  • 全面的训练工具:包含微调脚本,并支持 CTC 损失以集成音素级对齐。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目