amsehili/auditok
An voice activity detection and audio segmentation tool
해결하는 문제
auditok는 오디오 스트림에서 "소리가 어디에 있는지"를 찾는 데 도움을 주는 경량 오디오 활동 감지 라이브러리입니다. 무거운 신경망 없이 오디오 파일을 수동으로 이벤트로 분할하거나, 침묵을 제거하거나, 음성 세그먼트를 탐지하는 문제를 해결합니다.
작동 방식
이 라이브러리의 핵심은 에너지 임계값을 사용하여 오디오 스트림을 이벤트로 분할하는 것입니다. 임계값은 수동으로 설정하거나, "otsu"(균형) 또는 "percentile"(노이즈 레벨 + 마진)과 같은 방법으로 자동으로 추정할 수 있습니다. 더 정밀한 음성 탐지가 필요할 경우, WebRTC 음성 활동 감지기(VAD)를 프레임 단위 결정자로 선택적으로 통합할 수 있습니다.
대상 사용자
음성 활동 감지(VAD) 시스템, 침묵 제거 도구, 팟캐스트 및 언어 수업용 오디오 세그멘테이션을 개발하는 개발자들, 특히 속도와 낮은 계산 부담이 요구되는 경우에 적합합니다.
주요 기능
- 유연한 입력: 파일, 원시 바이트, 마이크 입력, 스트림(모노 및 멀티채널 오디오 포함)을 지원합니다.
- AudioRegion API: 오디오 세그먼트의 간편한 슬라이싱, 결합, 내보내기를 위한 중심적인 데이터 구조입니다.
- 자동 임계값 설정: 다양한 노이즈 레벨에 자동으로 적응하여 각 파일에 대한 수동 조정이 필요 없게 합니다.
- 명령줄 인터페이스: 터미널에서 직접 스트림 분할, 트리밍, 휴지 시간 정규화를 위한 서브커맨드를 제공합니다.
- Jupyter 통합: 노트북에서 탐지된 오디오 영역을 시각화하고 재생할 수 있는 인터랙티브 위젯을 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트