Xiaobin-Rong/gtcrn
The official implementation of GTCRN, an ultra-lightweight SE model.
解決する課題
GTCRNは、計算能力が極めて限られたデバイス上で高品質な音声強調(オーディオからのノイズ除去)を実行するという課題に対処します。通常、大量のメモリと処理リソースを必要とする大型モデルに代わる、軽量な選択肢を提供することを目指しています。
仕組み
このプロジェクトは、Grouped Temporal Convolutional Recurrent Networkを実装しています。非常に少ないパラメータ数(48.2K)と低い計算量(33.0 MMACs/秒)を使用することで効率を最適化しています。リアルタイム使用時のストリーミング性を維持するために、明示的なシャッフル層ではなく、全結合層を介した暗黙的な特徴再配置手法を採用しています。
対象者
リアルタイムオーディオ処理に取り組む開発者や研究者、特に従来のディープラーニングモデルでは重すぎるエッジデバイスや低電力ハードウェアを対象としている方に向けた設計となっています。
ハイライト
- 超低リソース使用量: パラメータ数はわずか48.2K、計算量は33.0 MMACs/秒。
- 高効率: 標準的なIntel i5 CPUにおいて0.07のリアルタイム係数(RTF)を達成。
- 競争力のあるパフォーマンス: RNNoiseを上回り、VCTK-DEMANDおよびDNS3データセットにおいて、より大型のモデルに対しても競争力を維持しています。
- デプロイ準備完了: ストリーミング推論機能とsherpa-onnxのサポートが含まれています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト