iver56/audiomentations

A Python library for audio data augmentation. Useful for making audio ML models work well in the real world, not just in the lab.

What it solves

オーディオディープラーニングモデルが、制御された実験室環境ではなく、実用環境でより高い性能を発揮するためのオーディオデータ拡張手法を提供します。

How it works

これは、ユーザーが Compose オブジェクトを使用してオーディオ変換のパイプライン(pipeline)を作成し、オーディオデータを摂動または変換するための Python ライブラリです。CPU 上で動作し、モノラルおよびマルチチャネルオーディオの両方をサポートしています。PyTorch や TensorFlow/Keras といった一般的なトレーニングパイプラインと統合可能です。

Who it’s for

トレーニングデータの多様性と堅牢性を高める必要がある、オーディオベースの AI モデルを構築する開発者や研究者です。

Highlights

  • ノイズ追加(Gaussian, color, background)、ピッチシフト、タイムストレッチ、ルームシミュレーションを含む、広範な変換リスト。
  • 使いやすさを追求し、albumentations にインスパイアされた API。
  • モノラルおよびマルチチャネルオーディオをサポート。
  • PyTorch や TensorFlow/Keras のトレーニングパイプラインと互換性があります。