nii-yamagishilab/project-NN-Pytorch-scripts

see README

解决的问题

本仓库提供了一系列用于语音处理的工具和脚本,特别聚焦于神经波形模型(声码器)和语音欺骗防御(反欺骗)技术,用于检测合成或篡改的音频。

工作原理

该项目组织为一系列基于 PyTorch 的实现库。包含用于训练和数据输入输出的核心脚本、已完成的 PyTorch 模块以及特定项目目录。每个项目通常包含一个 main.py 用于执行,一个 model.py 用于模型架构,以及一个 config.py 用于数据集设置。

适用人群

专为从事语音合成、音频取证和语音安全的研究人员与开发者设计,也适合希望学习如何实现神经声码器和反欺骗系统的人员。

主要亮点

  • 语音欺骗防御:多种实现,聚焦于置信度估计、自监督学习(SSL)特征提取器以及主动学习框架。
  • 神经声码器:实现了多种波形模型,包括 WaveNet、WaveGlow、iLPCNet 和神经源-滤波器(NSF)模型。
  • 教育资料:包含神经声码器、反欺骗和语音隐私挑战的教程。
  • 研究支持:包含与多个 ICASSP 和 SLT 发表论文相关的代码和资源。

相关

  • 项目
  • 项目
  • 项目
  • 项目