AutoArk/GPA
[AutoArk] GPA (General Purpose Audio) can do ASR, TTS and voice conversion with one tiny model!
解決的問題
GPA(通用音訊)解決了需要單一、統一的模型來處理多項核心音訊任務——自動語音辨識(ASR)、文字轉語音(TTS)和語音轉換(VC)——而非依賴於為每個功能分別使用的專用模型的需求。
工作原理
GPA 使用自回歸式 Transformer 架構來整合語音理解與生成。最新版本 GPA-v1.5 提供原生 PyTorch 與 Hugging Face 工作流程,用於推論與訓練。在部署方面,它提供 ONNX Runtime,支援 CLI 工具、FastAPI 服務與瀏覽器導向的 UI。此外,還提供一個獨立的輕量級 GPA-TTS 執行環境,專為 Mac、Linux 與邊緣裝置上的本地 CPU 推論優化,利用量化(INT4/INT8)技術減少其佔用空間。
適用對象
此專案適用於希望使用在 ASR 與 TTS 上達到接近 SOTA(最尖端)性能的統一音訊模型的 AI 研究人員與開發者,或尋找輕量級、邊緣就緒語音克隆 TTS 系統的使用者。
主要亮點
- 統一架構:將 ASR 與 TTS 合併為一個模型(VC 正在規劃中)。
- 接近 SOTA 性能:在 ASR 與 TTS 基準測試中,與更大模型相比表現具競爭力。
- 邊緣就緒 TTS:獨立的 GPA-TTS 執行環境,支援零樣本語音克隆與可選解碼器精度(INT8、FP16、FP32)。
- 廣泛部署支援:相容 torch、vLLM、llama-cpp、sglang 與 mlx-lm。
相關
- 專案
- 專案
- 專案
- 專案