Xiaobin-Rong/gtcrn

The official implementation of GTCRN, an ultra-lightweight SE model.

解決的問題

GTCRN 解決了在計算能力極其有限的設備上進行高品質語音增強(從音訊中去除雜訊)的挑戰。它旨在為通常需要大量記憶體和處理資源的龐大模型提供一種輕量級的替代方案。

工作原理

該專案實現了一個 Grouped Temporal Convolutional Recurrent Network。它透過使用極少的參數量 (48.2K) 和較低的計算操作 (每秒 33.0 MMACs) 來優化效率。為了保持即時使用的串流處理能力,它透過全連接層使用隱式特徵重排方法,而不是顯式的 shuffle 層。

適用對象

這專為從事即時音訊處理的開發人員和研究人員設計,特別是針對邊緣設備或低功耗硬體(傳統深度學習模型在這些設備上過於沉重)的研究人員。

亮點

  • 超低資源占用:僅使用 48.2K 參數和每秒 33.0 MMACs。
  • 高效率:在標準 Intel i5 CPU 上實現了 0.07 的即時因子 (RTF)。
  • 具競爭力的性能:在 VCTK-DEMAND 和 DNS3 資料集上優於 RNNoise,並能與大得多的模型相媲美。
  • 部署就緒:包含串流推理能力並支援 sherpa-onnx。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案