BUTSpeechFIT/DiariZen
A toolkit for speaker diarization.
解決する課題
DiariZenは、音声録音における「誰がいつ話したか」を特定するプロセスである話者ダイアリゼーションのためのツールキットです。特定の環境へのドメイン適応を必要とせず、多様なデータセットにおいて高精度なダイアリゼーションを提供することを目指しています。
仕組み
このツールキットは、AudioZenとPyannote 3.1によって駆動されます。自己教師あり学習(SSL)と構造的枝刈り(structured pruning)を活用して、コンパクトで正確なモデルを構築します。システムは、Hugging Faceの学習済みモデルと統合可能なパイプラインを介して、トレーニング、枝刈り、推論をサポートします。
対象ユーザー
効率的で汎用性の高い話者ダイアリゼーションシステムを必要とする、音声処理、音声分析、自動文字起こしサービスに従事する研究者や開発者。
特徴
- 高いパフォーマンス: AMI-SDM、AliMeeting、VoxConverseを含む複数のベンチマークにおいて、Pyannote v3.1を上回る性能を発揮します。
- モデル圧縮: 精度を維持しながら冗長なパラメータを削除するための、構造的枝刈りのレシピが含まれています。
- 使いやすさ: 推論用のシンプルなPython APIを提供し、結果をRTTM形式で保存することをサポートしています。
- 幅広いサポート: 最近のアップデートにより、ダイアリゼーションの精度向上のため、マルチチャネルWavLMをサポートしました。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト