Deep-unlearning/smol-audio
Practical, Colab-friendly notebooks for fine-tuning and running audio AI models
解决的问题
提供实用且可操作的指南,用于优化和定制音频AI模型,特别聚焦于将模型缩小并微调,以适应自动语音识别(ASR)和音频字幕等特定任务。
如何工作
该项目由一系列Jupyter笔记本组成,演示如何使用Hugging Face生态系统对各种音频模型进行微调。涵盖了多种技术,包括全量微调和低秩适应(LoRA),适用于Whisper、Granite Speech、Audio Flamingo 3、Parakeet和Voxtral等多种模型架构。
适用人群
希望将现有音频模型适配到自定义语言、特定领域或新任务(如音视频检索和分类)的开发者和AI实践者。
主要亮点
- 支持在多个模型(Whisper、Granite Speech、Parakeet、Voxtral)上进行ASR微调。
- 提供使用Audio Flamingo 3进行音频字幕的指南。
- 实现全量微调和LoRA,以实现高效的模型定制。
- 使用Meta的感知编码器用于音视频(PE-AV)进行零样本视频分类和音视频检索的示例。
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 项目