Deep-unlearning/smol-audio

Practical, Colab-friendly notebooks for fine-tuning and running audio AI models

解决的问题

提供实用且可操作的指南,用于优化和定制音频AI模型,特别聚焦于将模型缩小并微调,以适应自动语音识别(ASR)和音频字幕等特定任务。

如何工作

该项目由一系列Jupyter笔记本组成,演示如何使用Hugging Face生态系统对各种音频模型进行微调。涵盖了多种技术,包括全量微调和低秩适应(LoRA),适用于Whisper、Granite Speech、Audio Flamingo 3、Parakeet和Voxtral等多种模型架构。

适用人群

希望将现有音频模型适配到自定义语言、特定领域或新任务(如音视频检索和分类)的开发者和AI实践者。

主要亮点

  • 支持在多个模型(Whisper、Granite Speech、Parakeet、Voxtral)上进行ASR微调。
  • 提供使用Audio Flamingo 3进行音频字幕的指南。
  • 实现全量微调和LoRA,以实现高效的模型定制。
  • 使用Meta的感知编码器用于音视频(PE-AV)进行零样本视频分类和音视频检索的示例。

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 项目