BUTSpeechFIT/DiariZen

A toolkit for speaker diarization.

解決する課題

DiariZenは、音声録音における「誰がいつ話したか」を特定するプロセスである話者ダイアリゼーションのためのツールキットです。特定の環境へのドメイン適応を必要とせず、多様なデータセットにおいて高精度なダイアリゼーションを提供することを目指しています。

仕組み

このツールキットは、AudioZenとPyannote 3.1によって駆動されます。自己教師あり学習(SSL)と構造的枝刈り(structured pruning)を活用して、コンパクトで正確なモデルを構築します。システムは、Hugging Faceの学習済みモデルと統合可能なパイプラインを介して、トレーニング、枝刈り、推論をサポートします。

対象ユーザー

効率的で汎用性の高い話者ダイアリゼーションシステムを必要とする、音声処理、音声分析、自動文字起こしサービスに従事する研究者や開発者。

特徴

  • 高いパフォーマンス: AMI-SDM、AliMeeting、VoxConverseを含む複数のベンチマークにおいて、Pyannote v3.1を上回る性能を発揮します。
  • モデル圧縮: 精度を維持しながら冗長なパラメータを削除するための、構造的枝刈りのレシピが含まれています。
  • 使いやすさ: 推論用のシンプルなPython APIを提供し、結果をRTTM形式で保存することをサポートしています。
  • 幅広いサポート: 最近のアップデートにより、ダイアリゼーションの精度向上のため、マルチチャネルWavLMをサポートしました。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト