ServeurpersoCom/acestep.cpp
Portable C++17 implementation of ACE-Step 1.5 AI Music Generator using GGML. Text + lyrics in, stereo 48kHz MP3 or WAV out. Runs on CPU, CUDA, ROCm, Metal, Vulkan.
解決的問題
提供一個高性能的本地伺服器,用於根據文本描述生成 AI 音樂。使用者可以在自己的硬體上建立 48kHz 立體聲音訊軌道,而無需依賴雲端服務,支援包括 CPU 和各種 GPU 在內的廣泛硬體後端。
工作原理
該專案是基於 GGML 的原生 C++ 實作,作為 ACE-Step 1.5 模型的後端運行。它使用由語言模型 (LM) 生成歌詞和音訊代碼、擴散 Transformer (DiT) 渲染這些代碼以及變分自編碼器 (VAE) 生成最終音訊的流水線。系統包含一個用於輕鬆互動的瀏覽器 WebUI,以及供進階使用者將生成過程整合到其他應用程式中的 API。
適用對象
- 希望透過簡單介面在本地生成 AI 音樂的音樂家與創作者
- 希望透過 REST API 整合音樂生成功能的開發人員
- 傾向於在多種硬體(NVIDIA、AMD、Intel 或 Apple Silicon)上執行模型的進階使用者
亮點
- 廣泛的硬體支援:可在 CPU、CUDA、Metal 和 Vulkan 上執行。
- 靈活的模型選項:支援多種 LM 尺寸(0.6B 至 4B)和各種 DiT 變體(用於提速的 turbo 或用於品質的 sft)。
- 本地控制:具備用於編寫說明、設定歌詞和下載曲目的瀏覽器 UI,實現完全本地執行。
- C++ 實作:使用 GGML 和 GGUF 模型格式進行效能優化。
- 進階功能:支援用於風格微調的 LoRA 适配器,以及從現有音訊中提取元數據和歌詞的反向流水線。
相關
- 專案
- 專案
- 專案
- 專案
- 專案