ace-step/ACE-Step-1.5
The most powerful local music generation model that outperforms almost all commercial alternatives, supporting Mac, AMD, Intel, and CUDA devices.
ACE‑Step 1.5 – 開源音樂生成模型
是什麼 – ACE‑Step 1.5 是一個可在消費級硬體上生成完整音樂(從短迴圈到 10 分鐘曲目)的基礎模型。它結合了負責規劃歌曲(歌詞、結構、元資料)的語言模型與實際合成音訊的擴散Transformer(DiT)。該倉儲提供模型權重、推論程式碼、Gradio Web UI、REST API 以及輕量級 LoRA 微調工具。
核心功能
- 速度 – A100 上每首歌 <2 秒,RTX 3090 上 <10 秒;基礎模型可運行在 <4 GB VRAM 環境下。
- 品質 – 經基準測試,性能與商用服務相當(介於 Suno v4.5 與 Suno v5 之間);XL(4 B)版本進一步提升保真度。
- 控制 – 支援 50+ 種語言的提示驅動生成,可調節 BPM/音高/調式、時長、樂器音色。可選參考音訊用於模仿風格、製作翻唱、重繪段落或轉換人聲為伴奏。
- 個人化 – 僅需 8 首歌曲(RTX 3090 上約 1 小時)即可一鍵完成 LoRA 訓練,捕捉使用者風格。
- 多軌與編輯 – 支援生成音軌、添加層次、分離軌道,並輸出歌詞時間戳(LRC)。
如何使用
- 安裝輕量級
uv套件管理器並執行uv sync以設定環境。 - 使用
uv run acestep啟動 Gradio UI(或使用uv run acestep‑api啟動 REST API)。 - 選擇 DiT 模型(base、sft、turbo 或 XL)和可選語言模型(0.6 B–4 B)——UI 會根據你的 GPU 自動選擇最佳配置。
- 輸入文字描述(或上傳參考音訊檔案),點擊 Generate;系統將輸出 wav 檔案及可選元資料(BPM、音高、歌詞、音軌等)。
- 如需風格化微調,打開 Gradio 中的 LoRA Training 標籤頁,上傳小資料集並開始訓練。
模型庫 – 倉儲包含多個 DiT 檢查點:
acestep‑v15‑base(中等品質,快速)acestep‑v15‑sft(更高品質,監督微調)acestep‑v15‑turbo(極高速,CFG 步驟較少)- XL 版本(
‑xl‑base、‑xl‑sft、‑xl‑turbo)採用 4 B DiT 解碼器,實現最佳音訊保真度。
對應的語言模型檢查點(acestep‑5Hz‑lm‑0.6B/1.7B/4B)提供規劃、歌詞生成和音訊理解能力。
在不同硬體上執行 – 倉儲提供 Windows、Linux 和 macOS(Apple Silicon 透過 MLX)的啟動腳本。支援 CUDA、ROCm、Intel XPU 和純 CPU 模式,具備自動 INT8 量化與低 VRAM GPU 的卸載功能。
社群與擴充 – 提供 Discord 伺服器、"Awesome ACE‑Step" 清單以及 VST3 插件,便於整合至 DAW 中。專案採用 MIT 許可證,並包含關於生成音樂責任使用之明確免責聲明。
TL;DR – ACE‑Step 1.5 是一個在消費級 GPU 上運行的快速、高品質、開源音樂生成系統,支援廣泛提示控制,並提供一鍵 LoRA 微調以實現個人風格適配。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案