fishaudio/audio-preprocess
Preprocess Audio for training
해결하는 문제
고품질 음성 AI 모델을 훈련시키기 위해 음성 데이터를 준비하고 정리하는 것이 필수적입니다. 이 도구는 배경 노이즈 제거(보컬 분리), 볼륨 정규화, 포맷 변환과 같은 일반적인 전처리 작업을 처리합니다.
작동 방식
이 프로젝트는 다양한 음성 처리 스크립트를 실행하는 명령줄 도구(fap)입니다. 비디오나 음성 파일을 WAV 형식으로 변환하거나, 다른 소리에서 보컬을 분리하거나, 긴 음성 파일을 작은 조각으로 자르거나, 서로 다른 파일 간의 음량을 일치시키거나, FunASR 같은 도구를 사용해 음성 인식을 수행할 수 있습니다.
대상 사용자
기계 학습 파이프라인에서 사용하기 전에 원시 음성 파일의 정리, 자르기, 음성 인식을 자동화하고자 하는 개발자 및 연구자에게 적합합니다.
주요 기능
- 보컬 분리: 배경 노이즈나 음악에서 음성을 분리합니다.
- 자동 자르기: 긴 음성 파일을 다룰 수 있는 크기로 나눕니다.
- 음량 일치: 데이터셋 전체에 걸쳐 일관된 볼륨 수준을 보장합니다.
- 음성 인식: .lab 파일 생성을 지원하고 FunASR와 연동하여 자동 음성 인식을 수행합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트