filippogiruzzi/voice_activity_detection

Voice Activity Detection based on Deep Learning & TensorFlow

解決する課題

このプロジェクトは、音声信号内の音声とノイズを区別するリアルタイム音声活動検出(VAD)システムを実装しています。生のオーディオの処理、ディープラーニングモデルのトレーニング、および人間の声を含むオーディオセグメントを特定するための推論を行うための完全なパイプラインを提供します。

仕組み

システムは、特徴量抽出と分類モデルからなるパイプラインを使用します:

  1. 特徴量抽出: 1024サンプルのオーディオウィンドウ(16 kHz)を、MFCC(Mel-frequency cepstral coefficients)、MFCC deltas、MFCC delta-deltas、およびRMSエネルギーを使用して特徴量テンソルに変換します。
  2. 分類: これらの特徴量は、PyTorchで実装された1D-ResNet(Residual Network)に供給されます。モデルは、1D畳み込み、バッチ正規化、およびグローバル平均プーリングからなるスタックされた残差ブロックを使用し、音声ロジットを出力する全結合ヘッドで終了します。
  3. 推論: システムは、スライディングウィンドウ推論と、結果を洗練させるためのオプションのポストプロセッシング平滑化をサポートしています。

対象者

このプロジェクトは、オーディオ処理とディープラーニングに関心のある開発者や研究者、特にPyTorchを使用して軽量なVADシステムを実装または実験しようとしている方を対象としています。

ハイライト

  • 高精度: LibriSpeechデータセットで97%のテスト精度を達成。
  • フルパイプライン: 生のオーディオからのデータセット作成、トレーニング、および推論のためのツールが含まれています。
  • Dockerサポート: 一貫したデプロイのために、CPUおよびGPU対応のDockerイメージを提供します。
  • 柔軟なアーキテクチャ: 1D-ResNetモデルは、ModelConfig dataclassを介して設定可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト