Phi-2 在 Intel Meteor Lake 上:本地 LLM 推理
Hugging Face 已经展示,最先进的小型语言模型通过结合优化的硬件、高效的模型架构和量化,能够在中端笔记本电脑上本地运行。具体而言,Microsoft Phi-2 模型可以在 Intel Meteor Lake(Core Ultra)处理器上使用 4 位量化部署,从而在不依赖云端 AI 服务器的情况下实现可接受的性能。
启用本地 LLM 推理
- 隐私:数据保留在本地设备上,不会发送到外部服务器。
- 延迟:消除网络往返,降低响应时间。
- 连接性:模型可以完全离线运行。
- 成本:用户避免 API 调用和模型托管相关的费用。
- 可定制性:用户可以微调模型或实现本地检索增强生成(RAG)以完成特定任务。
Intel Meteor Lake 架构
Intel Meteor Lake 于 2023 年 12 月推出,并更名为 Core Ultra,是一种基于芯片块的架构,针对高性能笔记本电脑进行优化。它包含三个主要计算组件:
- CPU:一款功耗高效的处理器,最多可拥有 16 核心。
- 集成 GPU(iGPU):包括最多 8 个 Xe 核心。每个核心包含 16 个 Xe 向量引擎(XVE),能够进行 256 位向量运算,并实现 DP4a 指令以高效进行点积计算。
- 神经处理单元(NPU):专用的 AI 引擎,旨在实现功耗高效的客户端 AI 计算,减轻 CPU 和 iGPU 的负载。
Microsoft Phi-2 模型
Phi-2 是一个拥有 27 亿参数的模型,于 2023 年 12 月发布。尽管规模不大,Phi-2 在公开基准测试中优于多个 70 亿和 130 亿参数的模型,并且在与体积更大的 Llama-2 70B 模型竞争时表现出色,使其成为资源受限笔记本环境的理想选择。
通过 OpenVINO 与 Optimum Intel 进行量化
为了让 Phi-2 在笔记本硬件上可行,Hugging Face 使用了 Intel OpenVINO——一个用于优化 AI 推理的开源工具包,并将其集成到 optimum-intel 库中。
4 位权重量化
该实现使用 4 位权重量化来降低内存和计算需求。关键配置参数包括:
- 比例:控制量化为 4 位的权重比例(例如 80%),其余保持为 8 位。
- 组大小:定义权重量化组的大小(例如 128),每组共享一个缩放因子。
降低这些值通常可以提升模型精度,但会增加模型体积和推理延迟。
实现工作流
开发者可以使用以下流程部署模型:
- 安装
optimum[openvino,nncf]。 - 定义
OVWeightQuantizationConfig,指定位数、组大小和比例。 - 使用
OVModelForCausalLM加载模型,并将export=True以转换为 OpenVINO 格式。 - 编译模型并通过标准的 Hugging Face pipeline 进行推理。
性能结果
在配备 Core Ultra 7 155H CPU 的中端笔记本上进行测试表明,4 位量化的 Phi-2 模型在复杂任务(包括解答高中物理题目以及使用 NumPy 编写全连接层的 Python 类)中仍保持高输出质量。生成速度被描述为足以满足日常本地使用的需求。