amsehili/auditok

An voice activity detection and audio segmentation tool

何を解決するか

auditok は、音声ストリーム内の「音がどこにあるか」を検出するための軽量な音声活動検出ライブラリです。手動で音声ファイルをイベントに分割したり、無音を削除したり、重いニューラルネットワークを必要とせずに会話セグメントを検出する問題を解決します。

動作方法

このライブラリの核となるのは、エネルギー閾値を使用して音声ストリームをイベントに分割することです。閾値は手動で設定することも、"otsu"(バランス)や"percentile"(ノイズフロア + マージン)などの手法で自動的に推定することもできます。より正確な会話検出が必要な場合は、WebRTC音声活動検出器(VAD)をフレームレベルの判断基準としてオプションで統合できます。

対象ユーザー

音声処理に取り組む開発者、特に音声活動検出(VAD)システム、無音除去ツール、ポッドキャストや言語学習用の音声セグメンテーションを構築する人で、高速性と低計算負荷が求められる場合に適しています。

特徴

  • 柔軟な入力: ファイル、生のバイトデータ、マイク入力、ストリーム(モノラルおよびマルチチャネル音声を含む)に対応。
  • AudioRegion API: 音声セグメントの簡単なスライス、結合、エクスポートに使える中心的なデータ構造。
  • 自動閾値設定: 異なるノイズフロアに自動的に適応し、各ファイルごとの手動調整の必要を減らします。
  • コマンドラインインターフェース: 端末から直接ストリーム分割、トリミング、パウーズの正規化を行うためのサブコマンドを提供。
  • Jupyter統合: ノートブック内で検出された音声領域を視覚化し、再生できるインタラクティブウィジェットを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト