Phi-2 在 Intel Meteor Lake 上:本地 LLM 推論
Hugging Face 示範了最先進的小型語言模型可以透過結合最佳化硬體、有效的模型架構與量化,在中階筆記型電腦上本地執行。具體而言,Microsoft Phi-2 模型可部署於 Intel Meteor Lake(Core Ultra)處理器,使用 4 位元量化即可在不依賴雲端 AI 伺服器的情況下達到可接受的效能。
啟用本地 LLM 推論
本地推論移除對外部 API 的依賴,提供多項關鍵優勢:
- 隱私:資料保留在本地裝置,不會傳送至外部伺服器。
- 延遲:消除網路往返,縮短回應時間。
- 連線:模型可完全離線運作。
- 成本:使用者免除 API 呼叫與模型託管的費用。
- 可客製化:使用者可微調模型或實作本地檢索增強生成(RAG)以應對特定任務。
Intel Meteor Lake 架構
於 2023 年 12 月推出,並更名為 Core Ultra,Intel Meteor Lake 為一種以晶粒(chiplet)為基礎的架構,針對高效能筆記型電腦進行最佳化。它包含三大主要運算元件:
- CPU:具備高能源效率的處理器,最多支援 16 核心。
- 整合式 GPU(iGPU):包含最多 8 個 Xe 核心。每個核心內含 16 個 Xe 向量引擎(XVE),支援 256 位元向量運算,並實作 DP4a 指令以有效執行點積計算。
- 神經處理單元(NPU):專為能源效率設計的 AI 引擎,用於客戶端 AI 計算,減輕 CPU 與 iGPU 的負擔。
Microsoft Phi-2 模型
Phi-2 為 27 億參數模型,於 2023 年 12 月發布。儘管規模不大,Phi-2 在報告的基準測試中超越多個 70 億與 130 億參數模型,且在與更大型的 Llama-2 70B 模型的比較中表現相當,使其成為資源受限筆記型電腦環境的理想選擇。
透過 OpenVINO 與 Optimum Intel 進行量化
為了讓 Phi-2 能在筆記型電腦硬體上可行,Hugging Face 使用 Intel OpenVINO——一套開源的 AI 推論最佳化工具套件——並整合至 optimum-intel 函式庫中。
4 位元權重量化
此實作採用 4 位元權重量化以降低記憶體與計算需求。關鍵設定參數包括:
- 比例:控制以 4 位元量化的權重比例(例如 80%),其餘保持 8 位元。
- 群組大小:定義權重量化群組的大小(例如 128),每個群組共用一個縮放因子。
降低這些數值通常可提升模型準確度,但會增加模型大小與推論延遲。
實作工作流程
開發者可依照以下流程部署模型:
- 安裝
optimum[openvino,nncf]。 - 定義
OVWeightQuantizationConfig,指定位元數、群組大小與比例。 - 使用
OVModelForCausalLM並設置export=True以將模型轉換為 OpenVINO 格式。 - 編譯模型,並透過標準的 Hugging Face pipeline 執行推論。
效能結果
在搭載 Core Ultra 7 155H CPU 的中階筆記型電腦上測試,4 位元量化的 Phi-2 模型在複雜任務上仍能維持高品質輸出,包括解答高中物理題目以及使用 NumPy 撰寫全連接層的 Python 類別。生成速度被描述為足以應付日常本地使用。