BUTSpeechFIT/DiariZen

A toolkit for speaker diarization.

해결하는 문제

DiariZen은 오디오 녹음에서 "누가 언제 말했는지"를 결정하는 과정인 화자 다이어리제이션을 위한 툴킷입니다. 특정 환경에 대한 도메인 적응 없이도 다양한 데이터셋에서 높은 정확도의 다이어리제이션을 제공하는 것을 목표로 합니다.

작동 원리

이 툴킷은 AudioZen과 Pyannote 3.1을 기반으로 합니다. 자기 지도 학습(SSL)과 구조적 가지치기(structured pruning)를 활용하여 컴팩트하고 정확한 모델을 생성합니다. 시스템은 Hugging Face 사전 학습 모델과 통합할 수 있는 파이프라인을 통해 학습, 가지치기 및 추론을 지원합니다.

대상 사용자

효율적이고 일반화 가능한 화자 다이어리제이션 시스템이 필요한 음성 처리, 오디오 분석 및 자동 전사 서비스 분야의 연구자 및 개발자.

주요 특징

  • 고성능: AMI-SDM, AliMeeting, VoxConverse를 포함한 여러 벤치마크에서 Pyannote v3.1보다 뛰어난 성능을 보여줍니다.
  • 모델 압축: 정확도를 유지하면서 불필요한 파라미터를 제거하기 위한 구조적 가지치기 레시피를 포함합니다.
  • 사용 편의성: 추론을 위한 간단한 Python API를 제공하며, 결과를 RTTM 형식으로 저장하는 것을 지원합니다.
  • 폭넓은 지원: 최근 다이어리제이션 개선을 위해 멀티 채널 WavLM을 지원하도록 업데이트되었습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트