Apple Silicon macOS VMs: Accelerating LLM Inference with Metal Capability Shim

通过解锁 Metal 能力,macOS 虚拟机中的 LLM 推理速度可提升 11-16 倍

在 macOS 客户机中使用 Apple 的 Virtualization.framework 通过 llama.cpp 运行大语言模型 (LLM) 时,其速度明显慢于裸机性能,因为虚拟 GPU 报告的是保守的能力配置。通过使用进程范围的兼容性 shim 来报告更新的 Metal 能力,在 M1 Ultra 上,TinyLlama 1.1B 的提示词处理速度提升了 11.08xToken 生成速度提升了 16.36x

这种性能提升是因为该 shim 允许 llama.cpp 选择现代 Metal 内核——例如 SIMD-group 矩阵和 bfloat16 路径——这些内核是宿主机硬件支持但虚拟设备通常隐藏的。

根本原因:半虚拟化 GPU 能力限制

Apple 的 Virtualization.framework 使用半虚拟化技术,其中客户机中的虚拟图形设备将工作提交给一个专门构建的驱动程序,由宿主机在物理 GPU 上执行。与某些 Linux 环境中使用的 PCI 直通 (VFIO) 不同,宿主机对硬件保持着严格的控制。

在原生的 macOS 虚拟机中,虚拟设备报告的能力配置大致相当于 Apple 5 代系列,最大线程组内存仅为 32 KB。由于现代 Metal 应用程序在运行时查询设备以选择最高效的内核,llama.cpp 会根据这些保守的报告默认选择较慢的传统路径,即使底层的物理 Apple Silicon GPU 完全有能力处理更多内容。

解决方案:进程范围的 Metal 能力 Shim

为了绕过这些限制,Cua 开发了一个 Metal 能力 shim——一个插入应用程序和 API 之间的兼容层。该 shim 会拦截特定客户机进程的 Metal 能力查询,并修改返回的值以解锁高性能路径。

关键能力变化

能力 原生客户机 解锁配置
supportsFamily:1009 False True
SIMD-group matrix 关闭 开启
SIMD-group reduction 关闭 开启
bfloat16 关闭 开启
最大线程组内存 32 KB 64 KB

该 shim 特别针对 Apple 第 9 代 (1009) 及之后的 supportsFamily: 进行响应,并将报告的最大线程组内存翻倍至 64 KB。这足以触发 llama.cpp 中较新的 SIMD-group 和 bfloat16 路径的选择,而无需更改客户机内核或物理 GPU 分配。

性能基准测试

测试是在运行 macOS 26.6.1 的 Apple M1 Ultra (48-core GPU) 上进行的,客户机使用 Lume 0.5.1 中的 Tahoe 镜像 (macOS 26.5.2)。

TinyLlama 1.1B (Q4_K_M)

工作负载 裸机宿主机 原生客户机 解锁客户机 客户机加速
提示词处理 (512 tok) 4,871.99 tok/s 431.86 tok/s 4,786.70 tok/s 11.08x
Token 生成 (128 tok) 286.71 tok/s 12.63 tok/s 206.60 tok/s 16.36x

解锁后的虚拟机在提示词处理方面达到了裸机速度的 98.25%。

Gemma 4 12B (QAT Q4_0)

工作负载 裸机宿主机 原生客户机 解锁客户机 客户机加速
提示词处理 (512 tok) 517.88 tok/s 71.66 tok/s 515.76 tok/s 7.20x
Token 生成 (128 tok) 52.38 tok/s 3.41 tok/s 49.67 tok/s 14.54x

MLX-LM 兼容性

使用 MLX-LM 0.31.3 和 Llama-3.2-3B-Instruct-4bit 进行的测试显示性能持平(约 1.0x 比例)。这表明 MLX-LM 在原生虚拟机中已经在使用高效路径,这有助于开发人员改进 shim,以避免请求半虚拟化设备无法支持的驻留集 (residency sets)。

部署与实现

该 shim 作为研究成果发布在 Cua 仓库的 libs/lume/metal-capability-shim 目录下。实现需要以下步骤:

  1. 构建:使用提供的构建脚本编译特定架构的 dylibs。
  2. 宿主机配置:通过宿主机终端启用不受限制的功能级别: defaults write com.apple.gpusw.ParavirtualizedGraphics ForceUnrestrictedDeviceFeatureLevel -bool true
  3. 注入:在客户机中使用 DYLD_INSERT_LIBRARIES 启动工作负载,从而将 shim 限制在特定进程范围内。

局限性与技术限制

  • 版本敏感性:该 shim 依赖于客户机 Metal 实现的私有细节,可能会在 macOS 版本更新之间失效。
  • 进程范围:它仅影响被注入的进程及其子进程;经过加固的二进制文件可能会拒绝库注入。
  • 虚拟化开销:虽然它解锁了 GPU 内核,但它并不能消除 Virtualization.framework 桥接固有的开销。
  • 验证范围有限:目前的结果仅针对 M1 Ultra 和 Tahoe 客户机进行了验证;其他 Apple Silicon 代际需要进行独立测试。

社区观点

技术用户的讨论强调,这并不是针对所有 Mac 用户的通用 llama.cpp 加速,而是专门为那些在 Virtualization.framework 虚拟机中运行推理的用户提供的修复。一些用户质疑 Apple 为何在虚拟机中限制 Metal 配置,指出硬件能力非常强大,但软件抽象层却过于保守。

Sources

相关