snakers4/silero-vad
Silero VAD: pre-trained enterprise-grade Voice Activity Detector
해결하는 문제
Silero VAD는 오디오 스트림에 음성이 있는지 여부를 정확하게 식별하고 배경 소음 및 비음성 소리를 필터링하도록 설계된 사전 학습된 엔터프라이즈급 음성 활동 감지(VAD)입니다.
작동 방식
PyTorch 또는 ONNX Runtime를 통해 실행할 수 있는 경량 사전 학습 모델(크기 약 2MB)을 사용합니다. 이 모델은 6,000개 이상의 언어를 다루는 대규모 데이터 세트로 학습되어 다양한 도메인과 노이즈 수준에서 우수한 성능을 발휘합니다. 8,000Hz 및 16,000Hz 샘플링 속도를 지원합니다.
대상
음성 인터페이스, IoT/에지/모바일 애플리케이션, 전화 자동화, 콜센터 봇을 구축하는 개발자와 오디오 데이터 세트의 데이터 정리를 수행하는 사용자.
주요 특징
- 고성능: 단일 CPU 스레드에서 오디오 청크(30ms 이상)를 1ms 미만으로 처리합니다.
- 광범위한 언어 지원: 6,000개 이상의 언어로 학습되어 높은 견고성을 제공합니다.
- 높은 이식성: PyTorch 및 ONNX와 호환되어 C++, Rust, Go, Java, C#을 포함한 다양한 플랫폼에 배포할 수 있습니다.
- 경량화: 작은 모델 크기(약 2MB)로 에지 디바이스에 이상적입니다.
- 허용적인 라이선스: 텔레메트리나 벤더 종속성이 없는 MIT 라이선스입니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트