Xiaobin-Rong/gtcrn

The official implementation of GTCRN, an ultra-lightweight SE model.

解決する課題

GTCRNは、計算能力が極めて限られたデバイス上で高品質な音声強調(オーディオからのノイズ除去)を実行するという課題に対処します。通常、大量のメモリと処理リソースを必要とする大型モデルに代わる、軽量な選択肢を提供することを目指しています。

仕組み

このプロジェクトは、Grouped Temporal Convolutional Recurrent Networkを実装しています。非常に少ないパラメータ数(48.2K)と低い計算量(33.0 MMACs/秒)を使用することで効率を最適化しています。リアルタイム使用時のストリーミング性を維持するために、明示的なシャッフル層ではなく、全結合層を介した暗黙的な特徴再配置手法を採用しています。

対象者

リアルタイムオーディオ処理に取り組む開発者や研究者、特に従来のディープラーニングモデルでは重すぎるエッジデバイスや低電力ハードウェアを対象としている方に向けた設計となっています。

ハイライト

  • 超低リソース使用量: パラメータ数はわずか48.2K、計算量は33.0 MMACs/秒。
  • 高効率: 標準的なIntel i5 CPUにおいて0.07のリアルタイム係数(RTF)を達成。
  • 競争力のあるパフォーマンス: RNNoiseを上回り、VCTK-DEMANDおよびDNS3データセットにおいて、より大型のモデルに対しても競争力を維持しています。
  • デプロイ準備完了: ストリーミング推論機能とsherpa-onnxのサポートが含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト