amsehili/auditok
An voice activity detection and audio segmentation tool
何を解決するか
auditok は、音声ストリーム内の「音がどこにあるか」を検出するための軽量な音声活動検出ライブラリです。手動で音声ファイルをイベントに分割したり、無音を削除したり、重いニューラルネットワークを必要とせずに会話セグメントを検出する問題を解決します。
動作方法
このライブラリの核となるのは、エネルギー閾値を使用して音声ストリームをイベントに分割することです。閾値は手動で設定することも、"otsu"(バランス)や"percentile"(ノイズフロア + マージン)などの手法で自動的に推定することもできます。より正確な会話検出が必要な場合は、WebRTC音声活動検出器(VAD)をフレームレベルの判断基準としてオプションで統合できます。
対象ユーザー
音声処理に取り組む開発者、特に音声活動検出(VAD)システム、無音除去ツール、ポッドキャストや言語学習用の音声セグメンテーションを構築する人で、高速性と低計算負荷が求められる場合に適しています。
特徴
- 柔軟な入力: ファイル、生のバイトデータ、マイク入力、ストリーム(モノラルおよびマルチチャネル音声を含む)に対応。
- AudioRegion API: 音声セグメントの簡単なスライス、結合、エクスポートに使える中心的なデータ構造。
- 自動閾値設定: 異なるノイズフロアに自動的に適応し、各ファイルごとの手動調整の必要を減らします。
- コマンドラインインターフェース: 端末から直接ストリーム分割、トリミング、パウーズの正規化を行うためのサブコマンドを提供。
- Jupyter統合: ノートブック内で検出された音声領域を視覚化し、再生できるインタラクティブウィジェットを含む。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト