Stability-AI/stable-codec
A family of state-of-the-art Transformer-based audio codecs for low-bitrate high-quality audio coding.
解决的问题
提供一种高质量的语音编码系统,能够在保持高重建质量的同时,将音频压缩为低比特率的离散标记。它特别解决了语音合成(TTS)等下游任务所需的高效音频表示需求。
工作原理
该系统采用基于 Transformer 的架构,结合滑动窗口注意力机制,将音频编码为潜在变量和标记。使用有限标量量化(FSQ)瓶颈对音频进行离散化。为了提升标记在下游 AI 任务中的可用性,模型可通过连接时序分类(CTC)头进行微调,从潜在变量中回归出强制对齐的音素标签。
适用人群
从事语音合成、音频压缩和生成式音频模型的研究人员和开发者,需要一种高效方式将语音表示为离散标记。
主要亮点
- 灵活的比特率控制:支持训练后调整瓶颈配置,可更改标记字典大小和每秒比特数(bps)。
- 面向下游任务优化:
stable-codec-speech-16k变体经过专门微调,以增强潜在语义,提升 TTS 应用性能。 - 高效推理:利用 FlashAttention 优化滑动窗口注意力的处理效率。
- 全面的训练工具:包含微调脚本,并支持 CTC 损失以集成音素级对齐。
相关
- 项目
- 项目
- 项目
- 项目
- 项目