Xiaobin-Rong/gtcrn
The official implementation of GTCRN, an ultra-lightweight SE model.
해결하는 문제
GTCRN은 계산 능력이 매우 제한된 기기에서 고품질 음성 향상(오디오에서 노이즈 제거)을 수행하는 과제를 해결합니다. 이는 일반적으로 상당한 메모리와 처리 리소스를 요구하는 대형 모델의 경량화된 대안을 제공하는 것을 목표로 합니다.
작동 원리
이 프로젝트는 Grouped Temporal Convolutional Recurrent Network를 구현합니다. 매우 적은 수의 파라미터(48.2K)와 낮은 계산 연산량(초당 33.0 MMACs)을 사용하여 효율성을 최적화합니다. 실시간 사용을 위한 스트리밍 가능성을 유지하기 위해 명시적인 shuffle layer 대신 완전 연결 계층(fully connected layer)을 통한 암묵적 특징 재배치 방법을 사용합니다.
대상
이 모델은 실시간 오디오 처리를 연구하는 개발자와 연구자, 특히 기존 딥러닝 모델이 너무 무거운 에지 디바이스 또는 저전력 하드웨어를 대상으로 하는 분들을 위해 설계되었습니다.
주요 특징
- 초저사양 리소스 사용: 48.2K 파라미터와 초당 33.0 MMACs만 사용합니다.
- 높은 효율성: 표준 Intel i5 CPU에서 0.07의 실시간 계수(RTF)를 달성합니다.
- 경쟁력 있는 성능: RNNoise보다 성능이 뛰어나며, VCTK-DEMAND 및 DNS3 데이터셋에서 훨씬 더 큰 모델들과 비교해도 경쟁력이 있습니다.
- 배포 준비 완료: 스트리밍 추론 기능과 sherpa-onnx 지원을 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트