AutoArk/GPA

[AutoArk] GPA (General Purpose Audio) can do ASR, TTS and voice conversion with one tiny model!

解决的问题

GPA(通用音频)解决了需要一个单一、统一的模型来处理多种核心音频任务——自动语音识别(ASR)、文本转语音(TTS)和语音转换(VC)——而不是依赖于为每个功能分别使用的专用模型的需求。

工作原理

GPA 使用自回归 Transformer 架构来整合语音理解和生成。最新版本 GPA-v1.5 提供了原生 PyTorch 和 Hugging Face 工作流,用于推理和训练。在部署方面,它提供 ONNX Runtime,支持 CLI 工具、FastAPI 服务和基于浏览器的 UI。此外,还提供一个独立的轻量级 GPA-TTS 运行时,专为 Mac、Linux 和边缘设备上的本地 CPU 推理优化,利用量化(INT4/INT8)技术减少其占用空间。

适用人群

该项目适用于希望使用在 ASR 和 TTS 上达到接近 SOTA(最先进)性能的统一音频模型的 AI 研究人员和开发者,或希望获得轻量级、边缘就绪的语音克隆 TTS 系统的用户。

主要亮点

  • 统一架构:将 ASR 和 TTS 合并为一个模型(VC 仍在规划中)。
  • 接近 SOTA 性能:在 ASR 和 TTS 基准测试中,与更大模型相比表现具有竞争力。
  • 边缘就绪 TTS:独立的 GPA-TTS 运行时,支持零样本语音克隆和可选解码器精度(INT8、FP16、FP32)。
  • 广泛部署支持:兼容 torch、vLLM、llama-cpp、sglang 和 mlx-lm。

相关

  • 项目
  • 项目
  • 项目
  • 项目