Arm 与 ExecuTorch 0.7:将生成式 AI 扩展至数十亿设备
Arm 与 ExecuTorch 0.7 beta 默认集成 KleidiAI,以在广泛的 Arm CPU 架构上提供自动 AI 加速。此集成使生成式 AI(GenAI)和大语言模型(LLMs)能够在最新的高端硬件以及包括 Raspberry Pi 5 在内的五年内的设备上高效运行。
通过 KleidiAI 与 ExecuTorch 0.7 实现自动加速
ExecuTorch 0.7 beta 通过集成 Arm KleidiAI 为 Android 和跨平台开发者提供即插即用的性能。KleidiAI 充当 AI 加速层,嵌入到广泛使用的边缘 AI 框架,如 XNNPack、MediaPipe、MNN、ONNX Runtime 和 llama.cpp 中。
在 ExecuTorch 0.7 中默认启用 KleidiAI,开发者即可立即获得性能优化,无需自定义调优或代码更改。这将带来:
- 更快的模型启动
- 更低的延迟
- 更小的内存占用
利用 SDOT 实现广泛硬件兼容性
为了将 GenAI 的可及性扩展到旗舰智能手机之外,Arm 正在利用 SDOT(Signed Dot Product)指令。SDOT 在 Armv8.2 架构中引入,能够对 8 位有符号整数向量执行高效的点积运算,这对于加速使用 Int8 或 Int4 精度格式的 LLM 所需的矩阵乘法例程至关重要。
SDOT 在 Arm 生态系统中得到广泛支持,约出现在 30 亿台设备中(约占所有基于 Arm 设备的 72%)。这种广泛的可用性使得 Llama 3.2 1B 等模型能够在大多数 Android 设备以及 Raspberry Pi 5 等边缘硬件上高效运行。
性能基准与使用案例
高端硬件性能
ExecuTorch 与 KleidiAI 之前的合作聚焦于使用 I8MM 功能(Armv8.6 架构及以后)进行 Int4 矩阵乘法。在 Galaxy S24+ 上,此配置实现了:
- 预填充性能: 超过非 KleidiAI 内核的 20%,每秒超过 350 个 token。
- 解码性能: 每秒超过 40 个 token。
该性能足以满足实时设备端任务,例如对约 600 个 token(约 50 条未读消息)进行摘要,提供流畅的用户体验。
在旧硬件上的可访问性
虽然仅支持 SDOT 扩展的设备可能无法达到旗舰速度,但解码阶段通常仍快于普通人的阅读速度。这使得多种实用的离线 GenAI 场景成为可能:
- 私有智能助理: 将本地 LLM 与语音转文本和文本转语音模型结合,实现完全离线的语音交互。
- 上下文感知文本补全: 在本地文本编辑器中实时提供智能建议,支持写作或编码工作流,无需网络连接。
结论
通过 SDOT、KleidiAI 与 ExecuTorch 0.7 的组合,Arm 正在将生成式 AI 能力扩展至数十亿现有设备,使技术从高端旗舰迈向更广泛的全球硬件基础。