amsehili/auditok

An voice activity detection and audio segmentation tool

解决的问题

auditok 是一个轻量级的音频活动检测库,帮助用户在音频流中定位「声音出现在哪里」。它解决了手动将音频文件分割为事件、去除静音或检测语音段落的问题,而无需依赖重型神经网络。

工作原理

该库的核心是使用能量阈值将音频流分割为事件。阈值可手动设置,也可通过 "otsu"(平衡)或 "percentile"(噪声底噪 + 安全裕量)等方法自动估算。对于更精确的语音检测,可选择性地集成 WebRTC 语音活动检测器(VAD)作为帧级判断器。

适用人群

从事音频处理的开发者,例如构建语音活动检测(VAD)系统、静音去除工具,或为播客和语言课程进行音频分段,尤其在需要速度和低计算开销的场景下。

特色亮点

  • 灵活输入: 支持文件、原始字节、麦克风输入和流,包括单声道和多声道音频。
  • AudioRegion API: 用于轻松切片、合并和导出音频片段的中心数据结构。
  • 自动阈值: 能自动适应不同噪声水平,减少对每文件手动调参的需求。
  • 命令行界面: 提供子命令,可直接在终端中执行分割、裁剪和静音段归一化。
  • Jupyter 集成: 内置交互式组件,可在笔记本中可视化并播放检测到的音频区域。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目