snakers4/silero-vad

Silero VAD: pre-trained enterprise-grade Voice Activity Detector

解決する課題

Silero VADは、オーディオストリーム内に音声が存在するかどうかを正確に識別し、背景ノイズや非音声音をフィルタリングするように設計された、学習済みのエンタープライズグレードの音声活動検知(VAD)です。

仕組み

PyTorchまたはONNX Runtimeを介して実行可能な、軽量な学習済みモデル(サイズは約2MB)を使用しています。このモデルは6,000以上の言語をカバーする大規模なデータセットでトレーニングされており、さまざまなドメインやノイズレベルにおいて優れた性能を発揮します。サンプリングレートは8,000 Hzおよび16,000 Hzをサポートしています。

対象者

音声インターフェース、IoT/エッジ/モバイルアプリケーション、電話自動化、コールセンターボットを構築している開発者、およびオーディオデータセットのデータクリーニングを行う方々。

ハイライト

  • 高いパフォーマンス: 単一のCPUスレッドで、オーディオチャンク(30ms以上)を1ms未満で処理します。
  • 幅広い言語サポート: 6,000以上の言語でトレーニングされており、高い堅牢性を備えています。
  • 高いポータビリティ: PyTorchおよびONNXと互換性があり、C++、Rust、Go、Java、C#を含むさまざまなプラットフォームへのデプロイが可能です。
  • 軽量: 小規模なモデルサイズ(約2MB)により、エッジデバイスに最適です。
  • 寛容なライセンス: テレメトリやベンダーロックインのないMITライセンス。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト