nomadkaraoke/python-audio-separator
Easy to use stem (e.g. instrumental/vocals) separation from CLI or as a python package, using a variety of amazing pre-trained models (primarily from UVR)
解決的問題
Audio Separator 旨在將單一音訊檔案分割成多個獨立音軌(stems),例如將人聲與樂器分離。這對於製作卡拉OK音軌、去除噪音或分離特定樂器(如鼓、貝斯、鋼琴和吉他)特別有用。
運作方式
該工具利用來自 Ultimate Vocal Remover (UVR) 生態系統的預訓練 AI 模型,包括 MDX-Net、VR Arch、Demucs 和 MDXC/RoFormer 等架構。它支援多種硬體加速路徑以加快處理速度,包括 NVIDIA GPU (CUDA)、Apple Silicon (MPS/CoreML) 和 Windows AMD/Intel GPU (DirectML),並可退回使用 CPU 進行處理。
適用對象
適用於音樂製作人、卡拉OK創作者,以及希望將高品質音訊音軌分離整合到自己的 Python 專案中,或將其作為獨立命令列工具使用的開發者。
特色
- 多模型支援:針對不同樂器和音訊任務(例如:降噪、去除回音)使用各種專用模型。
- 自動模型管理:首次使用時自動下載所需的模型檔案。
- 廣泛的硬體加速:針對 CUDA、Apple Silicon 和 DirectML 進行最佳化,確保在不同作業系統上實現快速推論。
- 靈活整合:可作為 CLI 工具用於批次處理,也可作為 Python API 用於自訂軟體開發。
- 格式支援:支援所有常見的音訊格式,包括 WAV、MP3、FLAC 和 M4A。
相關
- 專案
- 專案
- 專案
- 專案
- 專案