Arm CPU上でのリアルタイムAIサウンド生成

クリエイティブワークフロー向けデバイス上AIオーディオ生成

Arm は、テキストプロンプトからスタジオ品質のサウンドを Arm ベースの CPU 上で直接作成できるパーソナルサウンド生成アプリケーションを実演しました。オープンソースの生成 AI モデルと効率的なデバイス上推論を活用することで、このツールは音楽プロデューサーがクラウドリソースや専用 GPU に依存せず、数秒でユニークな .wav ファイルを生成できるようにします。

技術アーキテクチャとモデル統合

サウンド生成エンジンは、オープンソースフレームワークと最適化されたハードウェア実行の組み合わせで構築されています。システムは以下の主要コンポーネントを利用します。

  • Model: Stability AI の Stable Audio Open モデルで、Hugging Face 経由で取得します。
  • Inference Frameworks: モデル推論とオーディオ信号処理に PyTorch と TorchAudio を使用します。
  • Hardware Execution: パイプラインは Arm ベースの CPU 上でネイティブに実行され、最適化されたマルチスレッド実行を利用して拡散処理中の応答性を維持します。

システムは Arm CPU 用に最適化されていますが、デバイスの柔軟性を保ち、コード内でデバイスターゲットを調整することで Metal(Apple Silicon)や CUDA(NVIDIA)でも実行できるよう構成可能です。

Arm CPU 向けパフォーマンス最適化

CPU ベースのハードウェアでリアルタイム性能を実現するため、実装ではレイテンシとメモリオーバーヘッドを削減する特定の最適化戦略を採用しています。

スレッド活用

Arm CPU の計算能力を最大化するため、アプリケーションは以下の PyTorch コマンドでスレッドのフル活用を有効にします。

torch.set_num_threads(os.cpu_count())

メモリ管理

メモリリークを防止し、複数回の生成にわたって安定性を保つため、システムは定期的にガベージコレクションをトリガーします。

if gen_count % 3 == 0:
    gc.collect()

推論チューニング

生成ループは拡散プロセスのステップ数を減らすことで速度向上のためにチューニングされ、必要な音響効果の品質を犠牲にせずに推論を高速化します。

output = generate_diffusion_cond(
    model,
    steps=7, # Reduced step count for faster inference
    cfg_scale=1,
    # ... other parameters
    sampler_type="dpmpp-3m-sde",
    device=device
)

デジタルオーディオワークステーション(DAW)との統合

このツールは、生成された .wav ファイルを Ableton Live が監視するプロジェクトフォルダーに出力することで、音楽制作ワークフローに直接統合できるよう設計されています。これにより、クリエイターはプロンプト(例: 「アナログベースライン」や「シネマティックリザー」)とテンポを入力すると、すぐに結果のオーディオファイルが Ableton のブラウザに表示され、さらにアレンジやモジュレーションが可能になります。

デバイス上 AI の意味合い

このプロトタイプは、Arm CPU 上で高計算量のクリエイティブタスクに対する効率的なデバイス上 AI 推論の実現可能性を示しています。このアプローチの主な利点は次のとおりです。

  • Reduced Latency: クラウド推論を排除することで、ネットワークリクエストに伴う待ち時間がなくなります。
  • Privacy and Ownership: デバイス上で生成することでデータがローカルに保たれ、クリエイターは出力物の完全な所有権を保持します。
  • Edge Deployment: これらのモデルを Arm CPU 上で実行できることにより、生成 AI の機能がエッジデバイスやプロフェッショナルなクリエイティブソフトウェアインターフェースに直接拡張されます。

Sources