Xiaobin-Rong/gtcrn

The official implementation of GTCRN, an ultra-lightweight SE model.

解决的问题

GTCRN 解决了在计算能力极其有限的设备上进行高质量语音增强(从音频中去除噪声)的挑战。它旨在为通常需要大量内存和处理资源的庞大模型提供一种轻量级的替代方案。

工作原理

该项目实现了一个 Grouped Temporal Convolutional Recurrent Network。它通过使用极少的参数量 (48.2K) 和较低的计算操作 (每秒 33.0 MMACs) 来优化效率。为了保持实时使用的流式处理能力,它通过全连接层使用隐式特征重排方法,而不是显式的 shuffle 层。

适用对象

这专为从事实时音频处理的开发人员和研究人员设计,特别是那些针对边缘设备或低功耗硬件(传统深度学习模型在这些设备上过于沉重)的研究人员。

亮点

  • 超低资源占用:仅使用 48.2K 参数和每秒 33.0 MMACs。
  • 高效率:在标准 Intel i5 CPU 上实现了 0.07 的实时因子 (RTF)。
  • 极具竞争力的性能:在 VCTK-DEMAND 和 DNS3 数据集上优于 RNNoise,并能与大得多的模型相媲美。
  • 部署就绪:包含流式推理能力并支持 sherpa-onnx。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目