BUTSpeechFIT/DiariZen
A toolkit for speaker diarization.
解決的問題
DiariZen 是一個用於說話人日誌(speaker diarization)的工具包——即確定音訊錄製中「誰在何時說話」的過程。其目標是在無需針對特定環境進行領域自適應的情況下,在各種數據集上提供高精度的說話人日誌功能。
工作原理
該工具包由 AudioZen 與 Pyannote 3.1 驅動。它利用自監督學習 (SSL) 與結構化剪枝來建立精簡且準確的模型。系統透過可以與 Hugging Face 預訓練模型集成的流水線,支援訓練、剪枝與推理。
適用對象
需要高效、通用說話人日誌系統的語音處理、音訊分析與自動逐字稿服務領域的研究人員與開發人員。
亮點
- 高性能:在包括 AMI-SDM、AliMeeting 與 VoxConverse 在內的多個基準測試中,表現優於 Pyannote v3.1。
- 模型壓縮:包含結構化剪枝方案,在保持準確性的同時去除冗餘參數。
- 易於使用:提供簡單的 Python API 用於推理,並支援以 RTTM 格式儲存結果。
- 廣泛支援:最近已更新以支援多通道 WavLM,從而提高說話人日誌的準確性。
相關
- 專案
- 專案
- 專案
- 專案
- 專案