amsehili/auditok
An voice activity detection and audio segmentation tool
解决的问题
auditok 是一个轻量级的音频活动检测库,帮助用户在音频流中定位「声音出现在哪里」。它解决了手动将音频文件分割为事件、去除静音或检测语音段落的问题,而无需依赖重型神经网络。
工作原理
该库的核心是使用能量阈值将音频流分割为事件。阈值可手动设置,也可通过 "otsu"(平衡)或 "percentile"(噪声底噪 + 安全裕量)等方法自动估算。对于更精确的语音检测,可选择性地集成 WebRTC 语音活动检测器(VAD)作为帧级判断器。
适用人群
从事音频处理的开发者,例如构建语音活动检测(VAD)系统、静音去除工具,或为播客和语言课程进行音频分段,尤其在需要速度和低计算开销的场景下。
特色亮点
- 灵活输入: 支持文件、原始字节、麦克风输入和流,包括单声道和多声道音频。
- AudioRegion API: 用于轻松切片、合并和导出音频片段的中心数据结构。
- 自动阈值: 能自动适应不同噪声水平,减少对每文件手动调参的需求。
- 命令行界面: 提供子命令,可直接在终端中执行分割、裁剪和静音段归一化。
- Jupyter 集成: 内置交互式组件,可在笔记本中可视化并播放检测到的音频区域。
相关
- 项目
- 项目
- 项目
- 项目
- 项目