ace-step/ACE-Step-1.5
The most powerful local music generation model that outperforms almost all commercial alternatives, supporting Mac, AMD, Intel, and CUDA devices.
ACE‑Step 1.5 – 开源音乐生成模型
是什么 – ACE‑Step 1.5 是一个可在消费级硬件上生成完整音乐(从短循环到10分钟曲目)的基础模型。它结合了负责规划歌曲(歌词、结构、元数据)的语言模型与实际合成音频的扩散Transformer(DiT)。该仓库提供了模型权重、推理代码、Gradio Web UI、REST API 以及轻量级 LoRA 微调工具。
核心功能
- 速度 – A100 上每首歌 <2 秒,RTX 3090 上 <10 秒;基础模型可运行在 <4 GB VRAM 环境下。
- 质量 – 经基准测试,性能与商用服务相当(介于 Suno v4.5 与 Suno v5 之间);XL(4 B)版本进一步提升保真度。
- 控制 – 支持 50+ 种语言的提示驱动生成,可调节 BPM/键/调式、时长、乐器音色。可选参考音频用于模仿风格、制作翻唱、重绘段落或转换人声为伴奏。
- 个性化 – 仅需 8 首歌曲(RTX 3090 上约 1 小时)即可一键完成 LoRA 训练,捕捉用户风格。
- 多轨与编辑 – 支持生成音轨、添加层次、分离轨道,并输出歌词时间戳(LRC)。
如何使用
- 安装轻量级
uv包管理器并运行uv sync以设置环境。 - 使用
uv run acestep启动 Gradio UI(或使用uv run acestep‑api启动 REST API)。 - 选择 DiT 模型(base、sft、turbo 或 XL)和可选语言模型(0.6 B–4 B)——UI 会根据你的 GPU 自动选择最佳配置。
- 输入文本描述(或上传参考音频文件),点击 Generate;系统将输出 wav 文件及可选元数据(BPM、键、歌词、音轨等)。
- 如需风格化微调,打开 Gradio 中的 LoRA Training 标签页,上传小数据集并开始训练。
模型库 – 仓库包含多个 DiT 检查点:
acestep‑v15‑base(中等质量,快速)acestep‑v15‑sft(更高质量,监督微调)acestep‑v15‑turbo(极高速,CFG 步骤较少)- XL 版本(
‑xl‑base、‑xl‑sft、‑xl‑turbo)采用 4 B DiT 解码器,实现最佳音频保真度。
对应的语言模型检查点(acestep‑5Hz‑lm‑0.6B/1.7B/4B)提供规划、歌词生成和音频理解能力。
在不同硬件上运行 – 仓库提供 Windows、Linux 和 macOS(Apple Silicon 通过 MLX)的启动脚本。支持 CUDA、ROCm、Intel XPU 和纯 CPU 模式,具备自动 INT8 量化与低 VRAM GPU 的卸载功能。
社区与扩展 – 提供 Discord 服务器、"Awesome ACE‑Step" 列表以及 VST3 插件,便于集成到 DAW 中。项目采用 MIT 许可证,并包含关于生成音乐负责任使用的明确免责声明。
TL;DR – ACE‑Step 1.5 是一个在消费级 GPU 上运行的快速、高质量、开源音乐生成系统,支持广泛提示控制,并提供一键 LoRA 微调以实现个人风格适配。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目