nomadkaraoke/python-audio-separator

Easy to use stem (e.g. instrumental/vocals) separation from CLI or as a python package, using a variety of amazing pre-trained models (primarily from UVR)

解決する課題

Audio Separator は、単一のオーディオファイルを複数の独立したトラック(ステム)に分割する(例えばボーカルを楽器から分離する)ために設計されています。これは、カラオケトラックの作成、ノイズの除去、またはドラム、ベース、ピアノ、ギターなどの特定楽器の分離に特に役立ちます。

仕組み

このツールは、MDX-Net、VR Arch、Demucs、MDXC/RoFormerなどのアーキテクチャを含む Ultimate Vocal Remover (UVR) エコシステムの事前学習済みAIモデルを活用します。処理を高速化するために、NVIDIA GPU (CUDA)、Apple Silicon (MPS/CoreML)、Windows AMD/Intel GPU (DirectML) を含む複数のハードウェアアクセラレーションパスをサポートし、CPU処理へのフォールバックも可能です。

対象者

音楽プロデューサー、カラオケクリエイター、および高品質なオーディオステム分離を独自の Python プロジェクトに統合したい、またはスタンドアロンのコマンドラインツールとして使用したい開発者向けです。

ハイライト

  • マルチモデルサポート:異なる楽器やオーディオタスク(例:ノイズ除去、エコー除去)に特化した多様なモデルを使用します。
  • 自動モデル管理:初回使用時に必要なモデルファイルを自動的にダウンロードします。
  • 幅広いハードウェアアクセラレーション:CUDA、Apple Silicon、DirectMLに最適化し、異なるOS間で高速な推論を実現します。
  • 柔軟な統合:バッチ処理用のCLIツールとしても、カスタムソフトウェア開発用の Python API としても利用可能です。
  • フォーマットサポート:WAV、MP3、FLAC、M4Aを含むすべての一般的なオーディオ形式で動作します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト