ace-step/ACE-Step-1.5

The most powerful local music generation model that outperforms almost all commercial alternatives, supporting Mac, AMD, Intel, and CUDA devices.

ACE‑Step 1.5 – 开源音乐生成模型

是什么 – ACE‑Step 1.5 是一个可在消费级硬件上生成完整音乐(从短循环到10分钟曲目)的基础模型。它结合了负责规划歌曲(歌词、结构、元数据)的语言模型与实际合成音频的扩散Transformer(DiT)。该仓库提供了模型权重、推理代码、Gradio Web UI、REST API 以及轻量级 LoRA 微调工具。

核心功能

  • 速度 – A100 上每首歌 <2 秒,RTX 3090 上 <10 秒;基础模型可运行在 <4 GB VRAM 环境下。
  • 质量 – 经基准测试,性能与商用服务相当(介于 Suno v4.5 与 Suno v5 之间);XL(4 B)版本进一步提升保真度。
  • 控制 – 支持 50+ 种语言的提示驱动生成,可调节 BPM/键/调式、时长、乐器音色。可选参考音频用于模仿风格、制作翻唱、重绘段落或转换人声为伴奏。
  • 个性化 – 仅需 8 首歌曲(RTX 3090 上约 1 小时)即可一键完成 LoRA 训练,捕捉用户风格。
  • 多轨与编辑 – 支持生成音轨、添加层次、分离轨道,并输出歌词时间戳(LRC)。

如何使用

  1. 安装轻量级 uv 包管理器并运行 uv sync 以设置环境。
  2. 使用 uv run acestep 启动 Gradio UI(或使用 uv run acestep‑api 启动 REST API)。
  3. 选择 DiT 模型(base、sft、turbo 或 XL)和可选语言模型(0.6 B–4 B)——UI 会根据你的 GPU 自动选择最佳配置。
  4. 输入文本描述(或上传参考音频文件),点击 Generate;系统将输出 wav 文件及可选元数据(BPM、键、歌词、音轨等)。
  5. 如需风格化微调,打开 Gradio 中的 LoRA Training 标签页,上传小数据集并开始训练。

模型库 – 仓库包含多个 DiT 检查点:

  • acestep‑v15‑base(中等质量,快速)
  • acestep‑v15‑sft(更高质量,监督微调)
  • acestep‑v15‑turbo(极高速,CFG 步骤较少)
  • XL 版本(‑xl‑base‑xl‑sft‑xl‑turbo)采用 4 B DiT 解码器,实现最佳音频保真度。

对应的语言模型检查点(acestep‑5Hz‑lm‑0.6B/1.7B/4B)提供规划、歌词生成和音频理解能力。

在不同硬件上运行 – 仓库提供 Windows、Linux 和 macOS(Apple Silicon 通过 MLX)的启动脚本。支持 CUDA、ROCm、Intel XPU 和纯 CPU 模式,具备自动 INT8 量化与低 VRAM GPU 的卸载功能。

社区与扩展 – 提供 Discord 服务器、"Awesome ACE‑Step" 列表以及 VST3 插件,便于集成到 DAW 中。项目采用 MIT 许可证,并包含关于生成音乐负责任使用的明确免责声明。


TL;DR – ACE‑Step 1.5 是一个在消费级 GPU 上运行的快速、高质量、开源音乐生成系统,支持广泛提示控制,并提供一键 LoRA 微调以实现个人风格适配。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目