pyannote/pyannote-audio

Neural building blocks for speaker diarization: speech activity detection, speaker change detection, overlapped speech detection, speaker embedding

解决的问题

提供一个用于说话人分离的工具包,即把音频记录分割成多个片段,并识别出谁在何时说话(即“谁在何时说话”问题)。

工作原理

基于 PyTorch 和 PyTorch Lightning 构建,该工具包通过 Hugging Face 提供预训练模型和流水线。支持本地执行(使用开源流水线如 community-1)和通过 pyannoteAI 专业服务进行云端执行(precision-2)。用户还可以在自己的数据上微调这些模型,以提升特定场景下的性能。

适用人群

需要准确识别和分离录音中不同说话人的音频数据开发者和研究人员。

主要亮点

  • 顶尖性能:在多个基准测试中表现优异(例如 AISHELL-4、AMI、VoxConverse)。
  • 灵活部署:支持在 GPU 上本地运行或使用基于 API 的专业服务。
  • 预训练资产:可通过 Hugging Face 模型库轻松访问模型和流水线。
  • 可扩展性:支持多 GPU 训练和自定义数据集的微调。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目