amsehili/auditok

An voice activity detection and audio segmentation tool

解決的問題

auditok 是一個輕量級的音訊活動檢測程式庫,協助使用者在音訊串流中找出「聲音出現在哪裡」。它解決了手動將音訊檔案分割為事件、移除靜音,或在不需使用重型神經網路的情況下偵測語音區段的問題。

工作原理

此程式庫的核心是使用能量閾值將音訊串流分割為事件。閾值可手動設定,也可使用「otsu」(平衡)或「percentile」(雜訊底噪 + 安全邊距)等方法自動估算。若需更精確的語音檢測,可選擇性地整合 WebRTC 語音活動偵測器(VAD)作為幀級判斷器。

適用對象

從事音訊處理的開發者,例如開發語音活動檢測(VAD)系統、靜音移除工具,或為播客與語言課程進行音訊分段,特別是在需要速度與低計算負載的場景下。

特色亮點

  • 靈活輸入: 支援檔案、原始位元組、麥克風輸入與串流,包含單聲道與多聲道音訊。
  • AudioRegion API: 用於輕鬆切片、合併與匯出音訊片段的中心資料結構。
  • 自動閾值: 能自動適應不同雜訊水平,減少對每檔檔案手動調校的需求。
  • 命令列介面: 提供子命令,可直接在終端機中執行分割、裁剪與靜音段歸一化。
  • Jupyter 結合: 內建互動式元件,可在筆記本中視覺化並播放偵測到的音訊區域。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案