Deep-unlearning/smol-audio
Practical, Colab-friendly notebooks for fine-tuning and running audio AI models
解決的問題
提供實用且具操作性的指南,用於優化與客製化音訊AI模型,特別聚焦於將模型縮小並微調,以適應自動語音辨識(ASR)與音訊字幕等特定任務。
如何運作
本專案由一系列Jupyter筆記本組成,示範如何使用Hugging Face生態系對各種音訊模型進行微調。涵蓋多種技術,包括完整微調與低秩適應(LoRA),適用於Whisper、Granite Speech、Audio Flamingo 3、Parakeet與Voxtral等多種模型架構。
適用對象
希望將現有音訊模型適應至自訂語言、特定領域或新任務(如音訊-影像檢索與分類)的開發者與AI實務者。
主要亮點
- 支援在多個模型(Whisper、Granite Speech、Parakeet、Voxtral)上進行ASR微調。
- 提供使用Audio Flamingo 3進行音訊字幕的指南。
- 實作完整微調與LoRA,以實現高效模型客製化。
- 使用Meta的感知編碼器用於音訊-影像(PE-AV)進行零樣本影片分類與音訊-文字檢索的範例。
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 專案