ServeurpersoCom/acestep.cpp

Portable C++17 implementation of ACE-Step 1.5 AI Music Generator using GGML. Text + lyrics in, stereo 48kHz MP3 or WAV out. Runs on CPU, CUDA, ROCm, Metal, Vulkan.

해결하는 문제

텍스트 설명을 기반으로 AI 음악을 생성할 수 있는 고성능 로컬 서버를 제공합니다. 클라우드 서비스에 의존하지 않고 자신의 하드웨어에서 스테레오 48kHz 오디오 트랙을 생성할 수 있으며, CPU 및 다양한 GPU를 포함한 폭넓은 하드웨어 백엔드를 지원합니다.

작동 원리

이 프로젝트는 GGML 기반의 네이티브 C++ 구현체로, ACE-Step 1.5 모델의 백엔드 역할을 합니다. 가사와 오디오 코드를 생성하는 언어 모델(LM), 해당 코드를 렌더링하는 Diffusion Transformer(DiT), 그리고 최종 오디오를 생성하는 Variational Autoencoder(VAE)로 구성된 파이프라인을 사용합니다. 시스템에는 쉬운 상호작용을 위한 브라우저 기반 WebUI와 고급 사용자가 생성 프로세스를 다른 애플리케이션에 통합할 수 있는 API가 포함되어 있습니다.

대상 사용자

  • 간단한 인터페이스로 로컬에서 AI 음악을 생성하고자 하는 음악가 및 크리에이터
  • REST API를 통해 음악 생성 기능을 통합하고자 하는 개발자
  • 다양한 하드웨어(NVIDIA, AMD, Intel 또는 Apple Silicon)에서 모델을 실행하는 것을 선호하는 파워 유저

주요 특징

  • 폭넓은 하드웨어 지원: CPU, CUDA, Metal 및 Vulkan에서 실행됩니다.
  • 유연한 모델 옵션: 다양한 LM 크기(0.6B ~ 4B) 및 다양한 DiT 변체(속도를 위한 turbo 또는 품질을 위한 sft)를 지원합니다.
  • 로컬 제어: 캡션을 작성하고, 가사를 설정하며, 트랙을 다운로드할 수 있는 브라우저 UI를 갖춘 완전한 로컬 실행을 지원합니다.
  • C++ 구현: GGML 및 GGUF 모델 형식을 사용하여 성능을 최적화했습니다.
  • 고급 기능: 스타일 튜닝을 위한 LoRA 어댑터와 기존 오디오에서 메타데이터 및 가사를 추출하는 역방향 파이프라인을 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트