Spr-Aachen/Easy-Voice-Toolkit
A user-friendly toolkit for voice recgonition/transcription/conversion etc. | 简单易用的语音工具箱
Easy Voice Toolkit – 빠른 개요
이것은 무엇인가 – 데스크톱과 Colab을 결합한 툴킷으로, 여러 오픈소스 음성 관련 모델(예: 전사용 Whisper, 음성 변환용 GPT-SoVITS)과 유틸리티를 연결하여 원시 오디오를 가져와 정리하고, 전사하고, 데이터셋을 구축하고, 음성 변환 모델을 학습시키고, 마지막으로 변환된 음성을 생성할 수 있습니다. 이 프로젝트는 즉시 실행 가능한 Windows 휴대용 패키지를 제공하며 클라우드 기반 사용을 위한 Jupyter 노트북도 제공합니다.
주요 기능
- 오디오 처리 – 트리밍, 슬라이싱, 형식 처리.
- 음성 인식 및 전사 – OpenAI의 Whisper 기반.
- 데이터셋 생성 – 음성 변환 학습용 쌍 오디오를 준비하는 도구.
- 모델 학습 – GPT-SoVITS 파이프라인을 래핑하여 새 음성 모델을 학습하는 스크립트.
- 음성 변환 – 입력 화자의 음성을 학습된 대상 음성 스타일로 변환합니다.
시작하는 방법
- Windows 사용자 – Windows 휴대용 패키지 다운로드 배지를 클릭하고 압축을 풀고
run.py를 실행합니다(Python 설치 불필요). - Colab 사용자 – 배지를 통해 Google Colab Demo 노트북을 열고 셀을 따라 종속성을 설치하고 클라우드에서 동일한 워크플로우를 실행합니다.
- 개발자 – 리포지토리를 클론하고(서브모듈 포함), Python ≥ 3.8을 설치하고, CUDA 버전에 맞는 PyTorch를 설치한 다음
pip install -r requirements.txt및pip install QEasyWidgets를 실행합니다.run.py를 실행하여 GUI 클라이언트와 백엔드 서버를 시작합니다.
일반적인 워크플로우
- 원시 오디오 가져오기 → 선택적 정리/슬라이싱.
- Whisper로 전사하여 텍스트 전사본을 얻습니다.
- 쌍 데이터셋 생성(소스 오디오 + 대상 음성 샘플).
- 해당 데이터셋으로 GPT-SoVITS 음성 변환 모델을 학습합니다.
- 새 발화를 변환하여 대상 음성처럼 들리는 음성을 생성합니다.
법적 / 사용 메모
- 학술 및 학습 목적으로만 사용되며 프로덕션용이 아닙니다.
- 결과(예: 비디오)를 게시할 때는 소스 오디오를 공개하고 원본 제작자와 이 리포지토리에 크레딧을 제공해야 합니다.
- 저자는 상업적 또는 비연구 목적으로 이 툴킷을 사용하기 전에 연락할 것을 요청합니다.
로드맵
- 대화형 음성 비서 기능을 위한 챗봇(LLM) 통합 계획.
- 성능 향상을 위해 클라이언트 UI를 C++/Qt로 리팩토링.
- 지속적인 백엔드 작업 및 향후 Linux 지원.
감사의 말(업스트림 프로젝트) – audio-slicer, VoiceprintRecognition-Pytorch, OpenAI Whisper, SRT-to-CSV-and-audio-split, GPT-SoVITS.
위의 모든 정보는 리포지토리의 README에서 직접 가져온 것이며 추가 기능은 추론되지 않았습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트