NeptuneHub/AudioMuse-AI

AudioMuse-AI uses sonic analysis to rediscover forgotten songs, uncover hidden connections in your music library, and generate intelligent playlists for Navidrome, Jellyfin, LMS, Lyrion, Emby and Plex: no metadata or external services required.

AudioMuse‑AI – AI駆動の音楽ライブラリーエクスプローラー

何であるか – プライベート音楽コレクション内のファイルの音声コンテンツを分析するオープンソースでセルフホスト可能なアプリケーション(タグや外部APIに依存しない)。各トラックに対して「音響フィンガープリント」を構築し、その結果をPostgreSQLデータベースに保存する。これらのフィンガープリントを使って、音声的に似た楽曲を自動グループ化し、2次元の視覚的マップでライブラリ全体をマッピングし、自然言語クエリ(例:高テンポ、低エネルギーの音楽)に応答できる。

なぜ重要か – 多くの音楽管理ツールはメタデータ(アーティスト、ジャンルなど)に依存しており、しばしば欠落または不正確である。AudioMuse‑AIは実際の音声に注目するため、トラック間の隠れた関係を発見し、楽曲が「どのように感じるか」に基づいたプレイリストを生成できる。


コア機能(READMEに記載)

機能 得られるもの
複数サーバー対応(v3.0.0+) Navidrome、Jellyfin、LMS、Lyrion、Emby、Plexの任意の組み合わせを1つのAudioMuse‑AIインスタンスに接続可能。重複検出により、各物理ファイルは一度だけ分析される。
クラスタリング & ミュージックマップ 音声的に似たトラックを自動グループ化し、2次元の視覚的マップで「音の領域」ごとにコレクションを探索できる。
即時プレイリスト AIに説明(例:高テンポ、低エネルギー)を提示すると、リアルタイムでプレイリストを生成。
類似楽曲からのプレイリスト お気に入りのトラックを選択し、その音響的特徴を共有するすべての楽曲を含む発見用プレイリストを取得。
ソングパス 任意の2曲間をつなぐ聴き応えのある聴取体験を生成。音声が滑らかに変化する中間トラックを含む。
音響フィンガープリント / 聴取習慣プレイリスト ユーザーが再生する内容を追跡し、個人の聴取傾向に合った楽曲を提案可能。
ソングアルケミー インタラクティブな「追加/削除」UIで雰囲気を微調整。2次元マップ上でプレビューし、最終リストをメディアサーバーに送信。
テキストおよび歌詞検索 気分、楽器、ジャンル、または歌詞内容で検索可能(72言語対応)。
録音による検索 20秒の音声スニペットをアップロードまたは録音し、ライブラリ内の一致するトラックを検索、または既知の楽曲の別録音を特定。

アーキテクチャの概要

  • Flask Web UI – ブラウザインターフェース、Swagger APIドキュメント、認証(JWTクッキー)を処理。
  • ワーカーコンテナ – 重い音声分析とクラスタリングを実行。CPUまたは、オプションでNVIDIA GPU(通常の-nvidiaイメージまたは実験的-nvidia-arm)で実行可能。
  • PostgreSQL v15 – フィンガープリント、クラスタリング結果、ユーザー設定、ジョブキューを保存(v2.6以降、キューはRedisからPostgreSQLに移行)。
  • プラグイン – シンプルなプラグインシステムにより、サードパーティ拡張機能を追加可能。プラグインはFlaskとワーカーコンテナにマウントされた共有ボリュームに永続化。
  • デプロイメント – Docker-Compose、Kubernetes用Helmチャート、macOS、Linux(deb/rpm)、Windows用ネイティブバイナリパッケージとして提供。

クイックスタート(Docker経由)

  1. リポジトリをクローンし、例のenvファイルをコピー:
    cp deployment/.env.example deployment/.env
    
  2. .envを編集(少なくともPOSTGRES_PASSWORDを設定)。
  3. スタックを起動
    docker compose -f deployment/docker-compose.yaml up -d
    
  4. http://localhost:8000を開き、Setup Wizardを実行 → メディアサーバーの分析を開始。
  5. 終了後、クラスタリング、ミュージックマップ、即時プレイリストなどのUIページを探索。

ネイティブ(コンテナ非使用)インストール

  • macOS(Apple Silicon)AudioMuse‑AI-arm64.zipをダウンロードし、セキュリティ解除フラグを解除、バンドルされたアプリを実行。
  • Linux.debまたは.rpm(x86_64またはaarch64)をインストール。サービスはaudiomuse‑ai startで起動、またはユーザー用systemdユニットとして有効化可能。
  • Windows – ポータブルアーカイブを解凍し、AudioMuse‑AI.exe startを実行。

すべてのネイティブパッケージには組み込みPostgreSQLインスタンスが含まれており、外部データベースは不要。


ハードウェアとパフォーマンスの注意点

  • 最低要件:AVX2対応4コアCPU(または最近のARM)、8GB RAM、NVMe SSD。
  • GPU加速はオプション。-nvidiaイメージはCUDAを使用して分析とクラスタリングを高速化。実験的-nvidia-armイメージはDGX SparkクラスのARM GPUを対象。
  • 仮想マシンはホストCPUのAVX2命令を公開する必要がある。AVX2なしのQEMUではサービスが停止する。

拡張性とコミュニティ

  • プラグインdocs/PLUGIN.mdにドキュメントあり。パブリックカタログは github.com/NeptuneHub/AudioMuse-AI-plugins に存在。
  • HelmチャートAudioMuse‑AI‑helmリポジトリはKubernetesデプロイ用の即時利用可能なHelmチャートを提供(AMD64およびARM64対応)。
  • 貢献 – プロジェクトはコード、ドキュメント、プラグインの貢献を歓迎。ガイドラインは CONTRIBUTING.md に記載。
  • マネージドクラウドオプション – Elestioはセルフホストを避けたいユーザー向けにホスティング版を提供。

リリースハイライト(最新)

  • v3.3.0 – ARMベースのNVIDIA GPU向けの実験的-nvidia-armイメージを追加。
  • v3.2.0 – ジョブキューをPostgreSQLに移行、Redisの不要化。
  • v3.0.0 – 重複検出付きのマルチサーバー対応を導入。
  • v2.6.0 – プラグインシステムを正式化。
  • v2.5.0 – Plex統合を追加。

まとめ

AudioMuse‑AIは本格的なAI駆動音楽ライブラリツールである:音響特徴を抽出し、埋め込み表現を構築し、その表現を使ってクラスタリング、類似検索、自然言語によるプレイリスト生成、視覚的探索を可能にする。プロジェクトは完全にオープンソースで、Docker、Kubernetes、ネイティブバイナリの複数のデプロイモデルを提供し、主要なセルフホストメディアサーバーと統合可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト