ace-step/ACE-Step-1.5
The most powerful local music generation model that outperforms almost all commercial alternatives, supporting Mac, AMD, Intel, and CUDA devices.
ACE‑Step 1.5 – 오픈소스 음악 생성 모델
무엇인가요 – ACE‑Step 1.5는 소비자급 하드웨어에서 전체 길이의 음악(짧은 루프부터 10분까지의 트랙)을 생성할 수 있는 기초 모델입니다. 이 모델은 곡의 가사, 구조, 메타데이터를 계획하는 언어 모델과 실제로 오디오를 합성하는 Diffusion‑Transformer(DiT)를 결합합니다. 리포지토리는 모델 가중치, 추론 코드, Gradio 웹 UI, REST API, 그리고 가벼운 LoRA 미세조정 도구를 제공합니다.
주요 기능
- 속도 – A100에서는 1곡당 <2초, RTX 3090에서는 <10초; 기준 모델은 <4 GB VRAM으로 작동 가능.
- 품질 – 상용 서비스와 비교해 동등한 성능(소노 v4.5와 v5 사이)을 입증. XL(4 B) 버전은 더 높은 정밀도를 제공.
- 제어력 – 50개 이상의 언어를 지원하는 프롬프트 기반 생성, BPM/키/스케일, 지속 시간, 악기 톤 조절 가능. 선택적 참조 오디오를 통해 스타일을 모방하거나 커버곡 생성, 섹션 재작성, 보컬을 악기 음악으로 변환 가능.
- 개인화 – 8곡 정도(3090에서 약 1시간)로 한 번의 클릭으로 LoRA 학습을 통해 사용자 스타일을 캡처.
- 멀티트랙 및 편집 – 스템 생성, 레이어 추가, 트랙 분리, 가사 타임스탬프(LRC) 출력 가능.
사용 방법
- 가벼운
uv패키지 매니저를 설치하고uv sync를 실행하여 환경을 설정. uv run acestep로 Gradio UI를 실행하거나uv run acestep‑api로 REST API를 실행.- DiT 모델(기본, SFT, 터보, XL)과 선택적 언어 모델(0.6 B–4 B)을 선택. UI가 GPU에 최적화된 구성 자동 선택.
- 텍스트 설명(또는 참조 오디오 파일)을 입력하고 Generate를 클릭. wav 파일과 선택적 메타데이터(BPM, 키, 가사, 스템 등)가 출력됨.
- 스타일 특화 미세조정을 원하면 Gradio의 LoRA Training 탭을 열고 작은 데이터셋을 업로드하여 학습 시작.
모델 자료관 – 리포지토리는 다음과 같은 DiT 체크포인트를 보유합니다:
acestep‑v15‑base(중간 품질, 빠름)acestep‑v15‑sft(높은 품질, 감독 미세조정)acestep‑v15‑turbo(매우 빠른 속도, 낮은 CFG 스텝)- XL 버전(
‑xl‑base,‑xl‑sft,‑xl‑turbo)은 최고의 오디오 품질을 위한 4 B DiT 디코더를 탑재.
해당 언어 모델 체크포인트(acestep‑5Hz‑lm‑0.6B/1.7B/4B)는 계획, 가사 생성, 오디오 이해 기능을 제공합니다.
다른 하드웨어에서 실행 – Windows, Linux, macOS(Apple Silicon은 MLX를 통해)용 실행 스크립트 제공. CUDA, ROCm, Intel XPU, CPU 전용 모드 지원. 저VRAM GPU용 자동 INT8 양자화 및 오프로딩 지원.
커뮤니티 및 확장 기능 – Discord 서버, "Awesome ACE‑Step" 목록, VST3 플러그인 제공으로 DAW에 통합 가능. 프로젝트는 MIT 라이선스이며, 생성된 음악의 책임 있는 사용에 대한 명확한 면책 조항 포함.
TL;DR – ACE‑Step 1.5는 소비자 GPU에서 작동하는 빠르고 고품질의 오픈소스 음악 생성 시스템으로, 광범위한 프롬프트 기반 제어와 사용자 스타일 적응을 위한 원클릭 LoRA 미세조정을 제공합니다.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트