iver56/audiomentations

A Python library for audio data augmentation. Useful for making audio ML models work well in the real world, not just in the lab.

What it solves

오디오 딥러닝 모델이 통제된 실험실 환경이 아닌 실제 환경에서 더 나은 성능을을 발휘할 수 있도록 오디오 데이터 증강을 수행하는 방법을 제공합니다.

How it works

사용자가 Compose 객체를 사용하여 오디오 변환 파이프라인(pipeline)을 생성하여 오디오 데이터를 섭동시키거나 변환할 수 있는 Python 라이브러리입니다. CPU에서 실행되며 모노 및 멀티채널 오디오를 모두 지원합니다. PyTorch 및 TensorFlow/Keras와 같은 일반적인 학습 파이프라인라인과 통합됩니다.

Who it’s for

학습 데이터의 다양성과 견고함을 높여야 하는 오디오 기반 AI 모델 개발자 및 연구자.

Highlights

  • 노이즈 추가(Gaussian, color, background), 피치 시프팅, 타임 스트레칭, 룸 시뮬레이션 등 광범위한 변환 목록.
  • 사용 편의성을 위해 albumentations에서 영감을 받은 API.
  • 모노 및 멀티채널 오디오를 지원합니다.
  • PyTorch 및 TensorFlow/Keras 학습 파이프라인과 호환됩니다.