fishaudio/audio-preprocess
Preprocess Audio for training
解決的問題
訓練高品質音訊AI模型時,音訊資料的準備與清理至關重要。此工具處理常見的前處理任務,例如去除背景雜訊(人聲分離)、音量歸一化與格式轉換。
運作方式
本專案為一個命令列工具(fap),可執行各種音訊處理腳本。可將影片或音訊檔案轉換為WAV格式,將人聲從其他聲音中分離,將長音訊檔案切分成較小的片段,匹配不同檔案間的音量,並使用FunASR等工具進行語音轉錄。
適用對象
需要在機器學習流程中使用前,自動化清理、切分與轉錄原始音訊檔案的開發者與研究人員。
主要特色
- 人聲分離:將語音從背景雜訊或音樂中分離。
- 自動切分:將長音訊檔案切分成可管理的小片段。
- 音量匹配:確保資料集中音量水準的一致性。
- 語音轉錄:支援產生 .lab 檔案,並可與 FunASR 整合以實現自動語音轉錄。
相關
- 專案
- 專案
- 專案
- 專案
- 專案