pyannote/pyannote-audio

Neural building blocks for speaker diarization: speech activity detection, speaker change detection, overlapped speech detection, speaker embedding

解決的問題

提供一個用於說話人分離的工具包,即將音訊記錄分割成多個片段,並識別誰在何時說話(即「誰在何時說話」問題)。

工作原理

基於 PyTorch 與 PyTorch Lightning 建構,該工具包透過 Hugging Face 提供預訓練模型與流程。支援本地執行(使用開源流程如 community-1)與透過 pyannoteAI 專業服務進行雲端執行(precision-2)。使用者亦可在自己的資料上微調這些模型,以提升特定情境下的效能。

適用對象

需要準確識別與分離錄音中不同說話人的音訊資料開發者與研究人員。

主要亮點

  • 頂尖效能:在多個基準測試中表現優異(例如 AISHELL-4、AMI、VoxConverse)。
  • 彈性部署:支援在 GPU 上本地執行或使用基於 API 的專業服務。
  • 預訓練資產:可透過 Hugging Face 模型庫輕鬆存取模型與流程。
  • 可擴展性:支援多 GPU 訓練與自訂資料集的微調。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案