pyannote/pyannote-audio

Neural building blocks for speaker diarization: speech activity detection, speaker change detection, overlapped speech detection, speaker embedding

何を解決するか

音声認識の分野において、音声記録をセグメントに分割し、誰がいつ話したかを特定する「誰がいつ話したか」の問題を解決するためのツールキットを提供します。

動作方法

PyTorch および PyTorch Lightning を基盤として構築されており、Hugging Face を通じて事前学習済みモデルとパイプラインを提供しています。ローカル実行(community-1 などのオープンソースパイプラインを使用)と、pyannoteAI プレミアムサービス(precision-2)を介したクラウドベースの実行の両方をサポートしています。ユーザーは独自のデータでこれらのモデルを微調整し、特定の用途における性能を向上させることも可能です。

対象ユーザー

音声データを扱い、記録内の異なる話者を正確に識別・分離する必要がある開発者や研究者。

特徴

  • 最先端の性能: AISHELL-4、AMI、VoxConverse などのさまざまなベンチマークで高い精度を実現。
  • 柔軟なデプロイ: GPU 上でのローカル実行または API ベースのプレミアムサービスに対応。
  • 事前学習済みアセット: Hugging Face モデルハブからモデルとパイプラインへの簡単なアクセス。
  • 拡張性: カスタムデータセット用のマルチGPUトレーニングおよび微調整をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト