nomadkaraoke/python-audio-separator
Easy to use stem (e.g. instrumental/vocals) separation from CLI or as a python package, using a variety of amazing pre-trained models (primarily from UVR)
解决的问题
Audio Separator 旨在将单个音频文件分割成多个独立音轨(stems),例如将人声与乐器分离。这对于制作卡拉OK音轨、去除噪音或分离特定乐器(如鼓、贝斯、钢琴和吉他)特别有用。
工作原理
该工具利用来自 Ultimate Vocal Remover (UVR) 生态系统的预训练 AI 模型,包括 MDX-Net、VR Arch、Demucs 和 MDXC/RoFormer 等架构。它支持多种硬件加速路径以加快处理速度,包括 NVIDIA GPU (CUDA)、Apple Silicon (MPS/CoreML) 和 Windows AMD/Intel GPU (DirectML),并可回退到 CPU 进行处理。
适用对象
适用于音乐制作人、卡拉OK创作者,以及希望将高质量音频音轨分离集成到自己的 Python 项目中,或将其作为独立命令行工具使用的开发者。
亮点
- 多模型支持:针对不同乐器和音频任务(例如:降噪、去除回音)使用各种专用模型。
- 自动模型管理:首次使用时自动下载所需的模型文件。
- 广泛的硬件加速:针对 CUDA、Apple Silicon 和 DirectML 进行优化,确保在不同操作系统上实现快速推理。
- 灵活集成:可作为 CLI 工具用于批处理,也可作为 Python API 用于自定义软件开发。
- 格式支持:支持所有常见的音频格式,包括 WAV、MP3、FLAC 和 M4A。
相关
- 项目
- 项目
- 项目
- 项目
- 项目