在 Arm CPU 上的即時 AI 音訊生成

設備端 AI 音訊生成以支援創意工作流程

Arm 展示了一款個人音訊生成應用程式,能夠直接在基於 Arm 的 CPU 上,從文字提示創建可直接使用於錄音室的音訊。透過利用開源生成式 AI 模型與高效的設備端推論,該工具讓音樂製作人能在數秒內產生獨特的 .wav 檔案,且不需依賴雲端資源或專用 GPU。

技術架構與模型整合

音訊生成引擎建立於多個開源框架與最佳化硬體執行的結合之上。系統使用以下核心元件:

  • Model: 由 Stability AI 提供、透過 Hugging Face 取得的 Stable Audio Open 模型。
  • Inference Frameworks: 使用 PyTorch 與 TorchAudio 進行模型推論與音訊訊號處理。
  • Hardware Execution: 管線在基於 Arm 的 CPU 上原生執行,利用最佳化的多執行緒執行以在擴散過程中保持回應性。

雖然系統針對 Arm CPU 進行了最佳化,但仍保有裝置彈性,透過在程式碼中調整設備目標,即可配置在 Metal(Apple Silicon)或 CUDA(NVIDIA)上執行。

針對 Arm CPU 的效能最佳化

為在基於 CPU 的硬體上達成即時效能,實作採用了特定的最佳化策略以降低延遲與記憶體負擔:

執行緒利用率

為了最大化 Arm CPU 的計算能力,應用程式使用以下 PyTorch 指令啟用完整的執行緒利用率:

torch.set_num_threads(os.cpu_count())

記憶體管理

為防止記憶體洩漏並在多次生成間維持穩定性,系統會定期觸發垃圾回收:

if gen_count % 3 == 0:
    gc.collect()

推論調校

透過減少擴散過程的步數來調校生成迴圈以提升速度,這可在不犧牲音效所需品質的前提下加速推論:

output = generate_diffusion_cond(
    model,
    steps=7, # Reduced step count for faster inference
    cfg_scale=1,
    # ... other parameters
    sampler_type="dpmpp-3m-sde",
    device=device
)

與數位音訊工作站 (DAW) 的整合

此工具設計為直接整合至音樂製作工作流程,會將生成的 .wav 檔案輸出至 Ableton Live 監控的專案資料夾。創作者只需輸入提示(例如「analog bassline」或「cinematic riser」)與節拍,即可立即在 Ableton 瀏覽器中看到相應的音訊檔案,進一步進行編排與調整。

對設備端 AI 的意涵

此原型展示了在 Arm CPU 上進行高效、設備端 AI 推論以應付高計算需求創意任務的可行性。此方法的主要優勢包括:

  • Reduced Latency: 消除雲端推論可移除與網路請求相關的等待時間。
  • Privacy and Ownership: 設備端生成確保資料保持本地,且創作者保有輸出成果的完整所有權。
  • Edge Deployment: 能在 Arm CPU 上執行這些模型,將生成式 AI 能力擴展至邊緣裝置,並直接整合至專業創意軟體介面。

Sources