nii-yamagishilab/project-NN-Pytorch-scripts

see README

해결하는 문제

이 저장소는 신경망 파형 모델(보코더)과 음성 위조 방지(반위조) 기술에 초점을 맞춘 음성 처리를 위한 도구와 스크립트의 모음입니다. 합성 또는 변조된 오디오를 탐지하는 데 사용됩니다.

작동 방식

이 프로젝트는 PyTorch 기반 구현의 라이브러리로 구성되어 있습니다. 핵심 트레이닝 및 데이터 I/O 스크립트, 완성된 PyTorch 모듈, 특정 프로젝트 디렉터리가 포함되어 있습니다. 각 프로젝트는 일반적으로 실행을 위한 main.py, 아키텍처를 위한 model.py, 데이터셋 설정을 위한 config.py를 포함합니다.

대상 사용자

음성 합성, 오디오 포렌식, 음성 보안 분야에서 일하는 연구자 및 개발자, 또는 신경망 보코더와 반위조 시스템을 구현하는 방법을 배우고자 하는 사람들을 대상으로 합니다.

주요 특징

  • 음성 위조 방지: 신뢰도 추정, 자기지도 학습(SSL) 특징 추출기, 활성 학습 프레임워크에 초점을 맞춘 여러 구현.
  • 신경망 보코더: WaveNet, WaveGlow, iLPCNet, 신경망 소스-필터(NSF) 모델 등 다양한 파형 모델의 구현.
  • 교육 자료: 신경망 보코더, 반위조, 음성 프라이버시 도전 과제에 대한 튜토리얼 포함.
  • 연구 기반: 여러 ICASSP 및 SLT 논문과 관련된 코드 및 자료 포함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트