在 Arm CPU 上的即時 AI 音訊生成
設備端 AI 音訊生成以支援創意工作流程
Arm 展示了一款個人音訊生成應用程式,能夠直接在基於 Arm 的 CPU 上,從文字提示創建可直接使用於錄音室的音訊。透過利用開源生成式 AI 模型與高效的設備端推論,該工具讓音樂製作人能在數秒內產生獨特的 .wav 檔案,且不需依賴雲端資源或專用 GPU。
技術架構與模型整合
音訊生成引擎建立於多個開源框架與最佳化硬體執行的結合之上。系統使用以下核心元件:
- Model: 由 Stability AI 提供、透過 Hugging Face 取得的 Stable Audio Open 模型。
- Inference Frameworks: 使用 PyTorch 與 TorchAudio 進行模型推論與音訊訊號處理。
- Hardware Execution: 管線在基於 Arm 的 CPU 上原生執行,利用最佳化的多執行緒執行以在擴散過程中保持回應性。
雖然系統針對 Arm CPU 進行了最佳化,但仍保有裝置彈性,透過在程式碼中調整設備目標,即可配置在 Metal(Apple Silicon)或 CUDA(NVIDIA)上執行。
針對 Arm CPU 的效能最佳化
為在基於 CPU 的硬體上達成即時效能,實作採用了特定的最佳化策略以降低延遲與記憶體負擔:
執行緒利用率
為了最大化 Arm CPU 的計算能力,應用程式使用以下 PyTorch 指令啟用完整的執行緒利用率:
torch.set_num_threads(os.cpu_count())
記憶體管理
為防止記憶體洩漏並在多次生成間維持穩定性,系統會定期觸發垃圾回收:
if gen_count % 3 == 0:
gc.collect()
推論調校
透過減少擴散過程的步數來調校生成迴圈以提升速度,這可在不犧牲音效所需品質的前提下加速推論:
output = generate_diffusion_cond(
model,
steps=7, # Reduced step count for faster inference
cfg_scale=1,
# ... other parameters
sampler_type="dpmpp-3m-sde",
device=device
)
與數位音訊工作站 (DAW) 的整合
此工具設計為直接整合至音樂製作工作流程,會將生成的 .wav 檔案輸出至 Ableton Live 監控的專案資料夾。創作者只需輸入提示(例如「analog bassline」或「cinematic riser」)與節拍,即可立即在 Ableton 瀏覽器中看到相應的音訊檔案,進一步進行編排與調整。
對設備端 AI 的意涵
此原型展示了在 Arm CPU 上進行高效、設備端 AI 推論以應付高計算需求創意任務的可行性。此方法的主要優勢包括:
- Reduced Latency: 消除雲端推論可移除與網路請求相關的等待時間。
- Privacy and Ownership: 設備端生成確保資料保持本地,且創作者保有輸出成果的完整所有權。
- Edge Deployment: 能在 Arm CPU 上執行這些模型,將生成式 AI 能力擴展至邊緣裝置,並直接整合至專業創意軟體介面。