nii-yamagishilab/project-NN-Pytorch-scripts

see README

解決的問題

本倉儲提供一系列用於語音處理的工具與指令碼,特別聚焦於神經波形模型(語音合成器)與語音偽造防禦(反偽造)技術,用於偵測合成或篡改的音訊。

工作原理

此專案組織為一組基於 PyTorch 的實作庫。包含訓練與資料輸入輸出的核心指令碼、完成的 PyTorch 模組,以及特定專案資料夾。每個專案通常包含一個 main.py 用於執行,一個 model.py 用於架構,以及一個 config.py 用於資料集設定。

適用對象

專為從事語音合成、音訊鑑識與語音安全的研究人員與開發者設計,也適合希望學習如何實作神經語音合成器與反偽造系統的人員。

主要亮點

  • 語音偽造防禦:多種實作,聚焦於置信度估計、自監督學習(SSL)特徵提取器與主動學習框架。
  • 神經語音合成器:實現多種波形模型,包括 WaveNet、WaveGlow、iLPCNet 與神經源-濾波器(NSF)模型。
  • 教育資源:包含神經語音合成器、反偽造與語音隱私挑戰的教學指南。
  • 研究支援:包含與多個 ICASSP 與 SLT 發表論文相關的程式碼與資源。

相關

  • 專案
  • 專案
  • 專案
  • 專案