ServeurpersoCom/acestep.cpp

Portable C++17 implementation of ACE-Step 1.5 AI Music Generator using GGML. Text + lyrics in, stereo 48kHz MP3 or WAV out. Runs on CPU, CUDA, ROCm, Metal, Vulkan.

解決する課題

テキストによる説明からAI音楽を生成するための、高性能なローカルサーバーを提供します。クラウドサービスに依存することなく、自身のハードウェア上でステレオ48kHzのオーディオトラックを作成することができ、CPUや様々なGPUを含む幅広いハードウェアバックエンドをサポートしています。

仕組み

このプロジェクトはGGMLによって駆動するネイティブC++実装であり、ACE-Step 1.5モデルのバックエンドとして機能します。歌詞とオーディオコードを生成する言語モデル(LM)、それらのコードをレンダリングするDiffusion Transformer(DiT)、そして最終的なオーディオを生成するVariational Autoencoder(VAE)からなるパイプラインを使用しています。システムには、簡単な操作を可能にするブラウザベースのWebUIと、高度なユーザーが生成プロセスを他のアプリケーションに統合するためのAPIが含まれています。

対象ユーザー

  • シンプルなインターフェースでローカルにAI音楽を生成したいミュージシャンやクリエイター
  • REST APIを介して音楽生成機能を統合したい開発者
  • 多様なハードウェア(NVIDIA、AMD、Intel、またはApple Silicon)でのモデル実行を好むパワーユーザー

ハイライト

  • 幅広いハードウェアサポート: CPU、CUDA、Metal、Vulkanで動作します。
  • 柔軟なモデルオプション: 複数のLMサイズ(0.6Bから4B)と、様々なDiTバリアント(速度重視のturbo、品質重視のsft)をサポートしています。
  • ローカルコントロール: キャプションの入力、歌詞の設定、トラックのダウンロードができるブラウザUIを備えた完全なローカル実行。
  • C++実装: GGMLおよびGGUFモデル形式を使用してパフォーマンスを最適化しています。
  • 高度な機能: スタイル調整用のLoRAアダプターや、既存のオーディオからメタデータと歌詞を抽出するリバースパイプラインをサポートしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト