Deep-unlearning/smol-audio

Practical, Colab-friendly notebooks for fine-tuning and running audio AI models

解決的問題

提供實用且具操作性的指南,用於優化與客製化音訊AI模型,特別聚焦於將模型縮小並微調,以適應自動語音辨識(ASR)與音訊字幕等特定任務。

如何運作

本專案由一系列Jupyter筆記本組成,示範如何使用Hugging Face生態系對各種音訊模型進行微調。涵蓋多種技術,包括完整微調與低秩適應(LoRA),適用於Whisper、Granite Speech、Audio Flamingo 3、Parakeet與Voxtral等多種模型架構。

適用對象

希望將現有音訊模型適應至自訂語言、特定領域或新任務(如音訊-影像檢索與分類)的開發者與AI實務者。

主要亮點

  • 支援在多個模型(Whisper、Granite Speech、Parakeet、Voxtral)上進行ASR微調。
  • 提供使用Audio Flamingo 3進行音訊字幕的指南。
  • 實作完整微調與LoRA,以實現高效模型客製化。
  • 使用Meta的感知編碼器用於音訊-影像(PE-AV)進行零樣本影片分類與音訊-文字檢索的範例。

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 專案