wavlab-speech/versa

Versatile Evaluation of Speech and Audio

解决的问题

VERSA 提供了一个统一的工具包,用于评估语音和音频质量。研究人员和开发者无需手动实现或集成数十种不同的评分方法,而是可以通过单一框架访问跨多个音频质量维度的 90 多个评估和分析指标。

工作原理

VERSA 作为大量音频指标的全面封装器和协调器。它将这些指标分为四类:独立型(无需参考)、依赖型(将预测值与参考值进行比较)、非匹配型和分布型(集合的统计特性)。该工具包支持多种输入格式,如文件路径、SCP 文件和 Kaldi 风格的 ARK 文件,并可通过 Slurm 在本地机器或集群上进行部署。它还集成了基于大语言模型的感知指标(例如基于 Qwen2-Audio 的指标),以提供更细致的音频分析。

适用人群

专为语音和音频研究人员、神经编码器开发者,以及任何需要标准化方式衡量性能的 AI 驱动音频生成或处理系统构建者设计。

主要亮点

  • 庞大的指标库:可访问 90 多个指标,涵盖感知质量、可懂度和技术测量。
  • 可扩展的基础设施:内置对 Slurm 分布式评估的支持,并支持中断后评分任务的恢复。
  • 灵活的输入/输出:与 ESPnet 等标准语音工具包兼容,支持多种音频输入格式。
  • LLM 集成:支持由大语言模型驱动的感知指标,实现高级音频质量评估。
  • 发现工具:包含 CLI 工具(versa-score),可列出可用指标,并根据任务生成推荐的配置文件。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目