ace-step/ACE-Step-1.5

The most powerful local music generation model that outperforms almost all commercial alternatives, supporting Mac, AMD, Intel, and CUDA devices.

ACE‑Step 1.5 – 오픈소스 음악 생성 모델

무엇인가요 – ACE‑Step 1.5는 소비자급 하드웨어에서 전체 길이의 음악(짧은 루프부터 10분까지의 트랙)을 생성할 수 있는 기초 모델입니다. 이 모델은 곡의 가사, 구조, 메타데이터를 계획하는 언어 모델과 실제로 오디오를 합성하는 Diffusion‑Transformer(DiT)를 결합합니다. 리포지토리는 모델 가중치, 추론 코드, Gradio 웹 UI, REST API, 그리고 가벼운 LoRA 미세조정 도구를 제공합니다.

주요 기능

  • 속도 – A100에서는 1곡당 <2초, RTX 3090에서는 <10초; 기준 모델은 <4 GB VRAM으로 작동 가능.
  • 품질 – 상용 서비스와 비교해 동등한 성능(소노 v4.5와 v5 사이)을 입증. XL(4 B) 버전은 더 높은 정밀도를 제공.
  • 제어력 – 50개 이상의 언어를 지원하는 프롬프트 기반 생성, BPM/키/스케일, 지속 시간, 악기 톤 조절 가능. 선택적 참조 오디오를 통해 스타일을 모방하거나 커버곡 생성, 섹션 재작성, 보컬을 악기 음악으로 변환 가능.
  • 개인화 – 8곡 정도(3090에서 약 1시간)로 한 번의 클릭으로 LoRA 학습을 통해 사용자 스타일을 캡처.
  • 멀티트랙 및 편집 – 스템 생성, 레이어 추가, 트랙 분리, 가사 타임스탬프(LRC) 출력 가능.

사용 방법

  1. 가벼운 uv 패키지 매니저를 설치하고 uv sync를 실행하여 환경을 설정.
  2. uv run acestep로 Gradio UI를 실행하거나 uv run acestep‑api로 REST API를 실행.
  3. DiT 모델(기본, SFT, 터보, XL)과 선택적 언어 모델(0.6 B–4 B)을 선택. UI가 GPU에 최적화된 구성 자동 선택.
  4. 텍스트 설명(또는 참조 오디오 파일)을 입력하고 Generate를 클릭. wav 파일과 선택적 메타데이터(BPM, 키, 가사, 스템 등)가 출력됨.
  5. 스타일 특화 미세조정을 원하면 Gradio의 LoRA Training 탭을 열고 작은 데이터셋을 업로드하여 학습 시작.

모델 자료관 – 리포지토리는 다음과 같은 DiT 체크포인트를 보유합니다:

  • acestep‑v15‑base (중간 품질, 빠름)
  • acestep‑v15‑sft (높은 품질, 감독 미세조정)
  • acestep‑v15‑turbo (매우 빠른 속도, 낮은 CFG 스텝)
  • XL 버전(‑xl‑base, ‑xl‑sft, ‑xl‑turbo)은 최고의 오디오 품질을 위한 4 B DiT 디코더를 탑재.

해당 언어 모델 체크포인트(acestep‑5Hz‑lm‑0.6B/1.7B/4B)는 계획, 가사 생성, 오디오 이해 기능을 제공합니다.

다른 하드웨어에서 실행 – Windows, Linux, macOS(Apple Silicon은 MLX를 통해)용 실행 스크립트 제공. CUDA, ROCm, Intel XPU, CPU 전용 모드 지원. 저VRAM GPU용 자동 INT8 양자화 및 오프로딩 지원.

커뮤니티 및 확장 기능 – Discord 서버, "Awesome ACE‑Step" 목록, VST3 플러그인 제공으로 DAW에 통합 가능. 프로젝트는 MIT 라이선스이며, 생성된 음악의 책임 있는 사용에 대한 명확한 면책 조항 포함.


TL;DR – ACE‑Step 1.5는 소비자 GPU에서 작동하는 빠르고 고품질의 오픈소스 음악 생성 시스템으로, 광범위한 프롬프트 기반 제어와 사용자 스타일 적응을 위한 원클릭 LoRA 미세조정을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트