Arm 与 ExecuTorch 0.7:将生成式 AI 扩展至数十亿设备

Arm 与 ExecuTorch 0.7 beta 默认集成 KleidiAI,以在广泛的 Arm CPU 架构上提供自动 AI 加速。此集成使生成式 AI(GenAI)和大语言模型(LLMs)能够在最新的高端硬件以及包括 Raspberry Pi 5 在内的五年内的设备上高效运行。

通过 KleidiAI 与 ExecuTorch 0.7 实现自动加速

ExecuTorch 0.7 beta 通过集成 Arm KleidiAI 为 Android 和跨平台开发者提供即插即用的性能。KleidiAI 充当 AI 加速层,嵌入到广泛使用的边缘 AI 框架,如 XNNPack、MediaPipe、MNN、ONNX Runtime 和 llama.cpp 中。

在 ExecuTorch 0.7 中默认启用 KleidiAI,开发者即可立即获得性能优化,无需自定义调优或代码更改。这将带来:

  • 更快的模型启动
  • 更低的延迟
  • 更小的内存占用

利用 SDOT 实现广泛硬件兼容性

为了将 GenAI 的可及性扩展到旗舰智能手机之外,Arm 正在利用 SDOT(Signed Dot Product)指令。SDOT 在 Armv8.2 架构中引入,能够对 8 位有符号整数向量执行高效的点积运算,这对于加速使用 Int8 或 Int4 精度格式的 LLM 所需的矩阵乘法例程至关重要。

SDOT 在 Arm 生态系统中得到广泛支持,约出现在 30 亿台设备中(约占所有基于 Arm 设备的 72%)。这种广泛的可用性使得 Llama 3.2 1B 等模型能够在大多数 Android 设备以及 Raspberry Pi 5 等边缘硬件上高效运行。

性能基准与使用案例

高端硬件性能

ExecuTorch 与 KleidiAI 之前的合作聚焦于使用 I8MM 功能(Armv8.6 架构及以后)进行 Int4 矩阵乘法。在 Galaxy S24+ 上,此配置实现了:

  • 预填充性能: 超过非 KleidiAI 内核的 20%,每秒超过 350 个 token。
  • 解码性能: 每秒超过 40 个 token。

该性能足以满足实时设备端任务,例如对约 600 个 token(约 50 条未读消息)进行摘要,提供流畅的用户体验。

在旧硬件上的可访问性

虽然仅支持 SDOT 扩展的设备可能无法达到旗舰速度,但解码阶段通常仍快于普通人的阅读速度。这使得多种实用的离线 GenAI 场景成为可能:

  • 私有智能助理: 将本地 LLM 与语音转文本和文本转语音模型结合,实现完全离线的语音交互。
  • 上下文感知文本补全: 在本地文本编辑器中实时提供智能建议,支持写作或编码工作流,无需网络连接。

结论

通过 SDOT、KleidiAI 与 ExecuTorch 0.7 的组合,Arm 正在将生成式 AI 能力扩展至数十亿现有设备,使技术从高端旗舰迈向更广泛的全球硬件基础。

Sources