kigner/audio.cpp-webui
audio.cpp with a full-task WebUI - pure C++ audio-model inference engine powered by ggml. TTS, ASR/STT, VAD, voice conversion, speaker diarization, music generation. No Python dependency.
解決的問題
本專案提供了一個高性能、可移植的 C++ 執行階段,用於在本地執行各種音訊 AI 模型。透過提供適用於 Windows、Linux 和 macOS 的共享原生執行階段,並支援 NVIDIA、AMD 和 Apple Silicon 硬體,消除了對複雜 Python 環境與依賴衝突的需求。
工作原理
該框架構建於 ggml 之上,為音訊模型提供了優化的執行路徑。它支援 GGUF 載入與量化(例如 Q8),從而減少 VRAM 使用並提高推理速度。系統包含一個基於 Gradio 的 WebUI 用於模型管理與執行,以及 CLI 與伺服器進入點。此外,還內建了用於降噪、重採樣與增強的音訊工具。
適用對象
想要以高效率與極低的設定開銷在本地執行最先進音訊模型(TTS、ASR、語音複製)的開發人員與使用者,特別是那些目標是生產級端到端執行而非簡單演示的使用者。
亮點
- 廣泛的模型支援: 支援超過 40 個模型系列,涵蓋文本轉語音 (TTS)、自動語音辨識 (ASR)、語音複製、聲源分離與音樂生成等任務。
- 極致性能: 比 Python 參考路徑有顯著提速,部分模型在 CUDA 上可實現高達 200 倍的實時執行速度。
- 硬體可移植性: 原生支援 CUDA、HIP/ROCm、Vulkan、Metal 與 CPU 後端。
- GGUF 整合: 大量使用 GGUF 以實現高效的模型載入並減少記憶體佔用。
- 整合 WebUI: 一個使用者友好的介面,無需 CLI 指令即可管理下載並執行音訊工作流。
相關
- 專案
- 專案
- 專案
- 專案
- 專案