kigner/audio.cpp-webui

audio.cpp with a full-task WebUI - pure C++ audio-model inference engine powered by ggml. TTS, ASR/STT, VAD, voice conversion, speaker diarization, music generation. No Python dependency.

解决的问题

本项目提供了一个高性能、可移植的 C++ 运行时,用于在本地运行各种音频 AI 模型。通过提供适用于 Windows、Linux 和 macOS 的共享原生运行时,并支持 NVIDIA、AMD 和 Apple Silicon 硬件,消除了对复杂 Python 环境和依赖冲突的需求。

工作原理

该框架构建在 ggml 之上,为音频模型提供了优化的执行路径。它支持 GGUF 加载和量化(例如 Q8),从而减少 VRAM 使用并提高推理速度。系统包含一个基于 Gradio 的 WebUI 用于模型管理和执行,以及 CLI 和服务器入口点。此外,还内置了用于降噪、重采样和增强的音频工具。

适用对象

想要以高效率和极低的设置开销在本地运行最先进音频模型(TTS、ASR、语音克隆)的开发人员和用户,特别是那些目标是生产级端到端执行而非简单演示的用户。

亮点

  • 广泛的模型支持: 支持超过 40 个模型系列,涵盖文本转语音 (TTS)、自动语音识别 (ASR)、语音克隆、声源分离和音乐生成等任务。
  • 极致性能: 比 Python 参考路径有显著提速,部分模型在 CUDA 上可实现高达 200 倍的实时运行速度。
  • 硬件可移植性: 原生支持 CUDA、HIP/ROCm、Vulkan、Metal 和 CPU 后端。
  • GGUF 集成: 大量使用 GGUF 以实现高效的模型加载并减少内存占用。
  • 集成 WebUI: 一个用户友好的界面,无需 CLI 命令即可管理下载和运行音频工作流。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目