iver56/audiomentations
A Python library for audio data augmentation. Useful for making audio ML models work well in the real world, not just in the lab.
What it solves
オーディオディープラーニングモデルが、制御された実験室環境ではなく、実用環境でより高い性能を発揮するためのオーディオデータ拡張手法を提供します。
How it works
これは、ユーザーが Compose オブジェクトを使用してオーディオ変換のパイプライン(pipeline)を作成し、オーディオデータを摂動または変換するための Python ライブラリです。CPU 上で動作し、モノラルおよびマルチチャネルオーディオの両方をサポートしています。PyTorch や TensorFlow/Keras といった一般的なトレーニングパイプラインと統合可能です。
Who it’s for
トレーニングデータの多様性と堅牢性を高める必要がある、オーディオベースの AI モデルを構築する開発者や研究者です。
Highlights
- ノイズ追加(Gaussian, color, background)、ピッチシフト、タイムストレッチ、ルームシミュレーションを含む、広範な変換リスト。
- 使いやすさを追求し、albumentations にインスパイアされた API。
- モノラルおよびマルチチャネルオーディオをサポート。
- PyTorch や TensorFlow/Keras のトレーニングパイプラインと互換性があります。