Arm 與 ExecuTorch 0.7:將生成式 AI 擴展至數十億設備

Arm 與 ExecuTorch 0.7 beta 正在預設整合 KleidiAI,以為廣泛的 Arm CPU 架構提供自動 AI 加速。此整合使生成式 AI(GenAI)與大型語言模型(LLMs)能在最新的高階硬體以及最舊至五年的裝置上高效運行,包含 Raspberry Pi 5。

透過 KleidiAI 與 ExecuTorch 0.7 的自動加速

ExecuTorch 0.7 beta 透過整合 Arm KleidiAI 為 Android 與跨平台開發者提供即插即用的效能。KleidiAI 作為 AI 加速層,嵌入廣泛使用的 Edge AI 框架,如 XNNPack、MediaPipe、MNN、ONNX Runtime 與 llama.cpp。

在 ExecuTorch 0.7 中預設啟用 KleidiAI,開發者即可立即取得效能最佳化,無需自訂調校或程式碼變更。其結果包括:

  • 更快的模型啟動
  • 更低的延遲
  • 更小的記憶體占用

利用 SDOT 擴展硬體相容性

為了將 GenAI 的可及性擴展至旗艦智慧手機之外,Arm 正利用 SDOT(Signed Dot Product)指令。SDOT 在 Armv8.2 架構中首次引入,能對 8 位元有號整數向量執行高效的點積運算,這對於加速使用 Int8 或 Int4 精度格式的 LLM 所需的矩陣乘法例程至關重要。

SDOT 在整個 Arm 生態系統中得到廣泛支援,約出現在 30 億台裝置(約佔所有 Arm 裝置的 72%)。此廣泛可用性使得 Llama 3.2 1B 等模型能在大多數 Android 裝置與如 Raspberry Pi 5 等邊緣硬體上高效運行。

效能基準與使用案例

高階硬體效能

先前 ExecuTorch 與 KleidiAI 的合作聚焦於使用 I8MM 功能(Armv8.6 架構及之後)進行 Int4 矩陣乘法。在 Galaxy S24+ 上,此配置達成了:

  • 預填效能: 超過非 KleidiAI 核心 20% 的提升,達到每秒超過 350 個 token。
  • 解碼效能: 每秒超過 40 個 token。

此效能足以支援即時裝置端任務,例如以流暢的使用者體驗摘要約 600 個 token(約 50 則未讀訊息)。

在舊硬體上的可及性

雖然僅支援 SDOT 擴充的裝置速度可能不及旗艦機型,但解碼階段通常仍快於一般人類閱讀速度。這使得多種實用的離線 GenAI 使用案例成為可能:

  • 私密智慧助理: 結合本地 LLM 與語音轉文字、文字轉語音模型,實現完全離線、語音互動。
  • 情境感知文字補全: 在本地文字編輯器中即時提供智慧建議,支援寫作或程式開發工作流程,且不需網路連線。

結論

透過 SDOT、KleidiAI 與 ExecuTorch 0.7 的結合,Arm 正將生成式 AI 能力擴展至數十億現有裝置,將此技術從高階旗艦推向更廣泛的全球硬體基礎。

Sources