ace-step/ACE-Step-1.5

The most powerful local music generation model that outperforms almost all commercial alternatives, supporting Mac, AMD, Intel, and CUDA devices.

ACE‑Step 1.5 – 開源音樂生成模型

是什麼 – ACE‑Step 1.5 是一個可在消費級硬體上生成完整音樂(從短迴圈到 10 分鐘曲目)的基礎模型。它結合了負責規劃歌曲(歌詞、結構、元資料)的語言模型與實際合成音訊的擴散Transformer(DiT)。該倉儲提供模型權重、推論程式碼、Gradio Web UI、REST API 以及輕量級 LoRA 微調工具。

核心功能

  • 速度 – A100 上每首歌 <2 秒,RTX 3090 上 <10 秒;基礎模型可運行在 <4 GB VRAM 環境下。
  • 品質 – 經基準測試,性能與商用服務相當(介於 Suno v4.5 與 Suno v5 之間);XL(4 B)版本進一步提升保真度。
  • 控制 – 支援 50+ 種語言的提示驅動生成,可調節 BPM/音高/調式、時長、樂器音色。可選參考音訊用於模仿風格、製作翻唱、重繪段落或轉換人聲為伴奏。
  • 個人化 – 僅需 8 首歌曲(RTX 3090 上約 1 小時)即可一鍵完成 LoRA 訓練,捕捉使用者風格。
  • 多軌與編輯 – 支援生成音軌、添加層次、分離軌道,並輸出歌詞時間戳(LRC)。

如何使用

  1. 安裝輕量級 uv 套件管理器並執行 uv sync 以設定環境。
  2. 使用 uv run acestep 啟動 Gradio UI(或使用 uv run acestep‑api 啟動 REST API)。
  3. 選擇 DiT 模型(base、sft、turbo 或 XL)和可選語言模型(0.6 B–4 B)——UI 會根據你的 GPU 自動選擇最佳配置。
  4. 輸入文字描述(或上傳參考音訊檔案),點擊 Generate;系統將輸出 wav 檔案及可選元資料(BPM、音高、歌詞、音軌等)。
  5. 如需風格化微調,打開 Gradio 中的 LoRA Training 標籤頁,上傳小資料集並開始訓練。

模型庫 – 倉儲包含多個 DiT 檢查點:

  • acestep‑v15‑base(中等品質,快速)
  • acestep‑v15‑sft(更高品質,監督微調)
  • acestep‑v15‑turbo(極高速,CFG 步驟較少)
  • XL 版本(‑xl‑base‑xl‑sft‑xl‑turbo)採用 4 B DiT 解碼器,實現最佳音訊保真度。

對應的語言模型檢查點(acestep‑5Hz‑lm‑0.6B/1.7B/4B)提供規劃、歌詞生成和音訊理解能力。

在不同硬體上執行 – 倉儲提供 Windows、Linux 和 macOS(Apple Silicon 透過 MLX)的啟動腳本。支援 CUDA、ROCm、Intel XPU 和純 CPU 模式,具備自動 INT8 量化與低 VRAM GPU 的卸載功能。

社群與擴充 – 提供 Discord 伺服器、"Awesome ACE‑Step" 清單以及 VST3 插件,便於整合至 DAW 中。專案採用 MIT 許可證,並包含關於生成音樂責任使用之明確免責聲明。


TL;DR – ACE‑Step 1.5 是一個在消費級 GPU 上運行的快速、高品質、開源音樂生成系統,支援廣泛提示控制,並提供一鍵 LoRA 微調以實現個人風格適配。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案