在 Intel Core Ultra 上使用深度裁剪草稿模型加速 Qwen3-8B

TL;DR

在 Intel® Core™ Ultra 上使用投機解碼與深度裁剪的 Qwen3‑0.6B 草稿模型加速 Qwen3-8B,達到約 ~1.4× 的提速,讓本地 AI 代理透過 🤗 smolagents 以更快速度運行。

Qwen3‑8B:為代理工作流程打造的模型

Qwen3‑8B 是 Qwen 系列的最新發佈,具備工具調用、多步推理與長上下文處理等原生代理行為。這些能力使其非常適合 AI‑PC(AIPC)情境,在此情境下大型語言模型必須產生「思考過程」的追蹤與中間步驟,這會增加 token 使用量並需要高推理吞吐量。結合 🤗 smolagents、QwenAgent 或 AutoGen 等代理框架時,Qwen3‑8B 能驅動呼叫 API、編寫程式碼以及執行複雜推理的應用。

使用投機解碼在 Intel® Core™ Ultra 上加速 Qwen3‑8B

投機解碼(見 arXiv:2211.17192)透過讓較小的草稿模型在一次前向傳播中提出多個 token,然後由較大的目標模型驗證,以加速自回歸生成。在 Intel Core Ultra 基準測試中:

  • 目標模型 – 使用 OpenVINO(OpenVINO 2025.2)量化為 INT4 的 Qwen3‑8B。
  • 草稿模型 – 使用 OpenVINO 量化為 INT8 的 Qwen3‑0.6B。
  • 硬體 – 搭載 Core Ultra 7 268V、32 GB DDR5 的 Intel Lunar Lake 整合式 GPU(Arc 140V)。

此配置相較於基線 4‑bit OpenVINO 推理,平均提升 1.3×

from openvino_genai import LLMPipeline, draft_model

target_path = "/path/to/target/Qwen3-8B-int4-ov"
draft_path  = "/path/to/draft/Qwen3-0.6B-int8-ov"
device = "GPU"

model = LLMPipeline(target_path, device,
                    draft_model=draft_model(draft_path, device))

streamer = lambda x: print(x, end="", flush=True)
model.generate(
    "What is speculative decoding and how does it improve inference speed?",
    max_new_tokens=100,
    streamer=streamer,
)

注意: 目標模型與草稿模型皆必須轉換為 OpenVINO 格式。預先轉換好的模型可從部落格文章中的連結取得,或依照 OpenVINO 匯出指南操作。

透過深度裁剪草稿模型進一步提升效能

投機解碼的理論加速比為

$$ \text{Speedup}=\frac{E[#\text{generated tokens}]}{\gamma c + 1}, $$

其中 (\gamma) 為目標模型每步產生的平均 token 數,(c) 為目標與草稿之間的延遲比率,分子則代表每個投機窗口預期產生的 token 數量。降低草稿延遲(較小的 (c))即可提升整體速度。

分層裁剪草稿模型

近期研究顯示模型深度是推理延遲的主要因素。受分層壓縮研究啟發,作者測量各層輸出的角度距離,以辨識影響較低的區塊並將其移除。於 Qwen3‑0.6B 的 28 層中裁剪了 6 層,之後在由 Qwen3‑8B 以 BAAI/Infinity‑Instruct 資料集的 50 萬個提示產生的合成資料上微調草稿模型。

獲得的效益

深度裁剪的草稿模型(可於 OpenVINO/Qwen3-pruned-6L-from-0.6B-int8-ov 取得)將投機解碼的加速比提升至 ~1.4×,相較於基線,驗證了草稿模型更快即可帶來更高整體吞吐量的預期。

完整重現這些步驟的 notebook 已在文章中提供連結:https://github.com/openvinotoolkit/openvino_notebooks/blob/latest/supplementary_materials/notebooks/qwen-3/qwen3.ipynb

與 🤗 smolagents 的整合

為了展示實際效益,已將加速的 Qwen3‑8B 與裁剪草稿模型結合,整合至 🤗 smolagents 函式庫。開發者現在可以建立本地 AI 代理,具備以下功能:

  1. 呼叫外部工具(例如網路搜尋)。
  2. 執行 Python 程式碼(例如使用 python-pptx 產生 PowerPoint 投影片)。
  3. 在 Intel Core Ultra 硬體上有效處理長上下文推理。

示範任務要求代理 彙總 Qwen3 系列的主要特點並製作投影片。工作流程結合了網路搜尋工具與 Python 直譯器,說明了加速的代理模型如何在消費級硬體上實現端對端 AI 應用。

相同的模型組合亦可與 AutoGen 或 QwenAgent 等其他代理框架一起使用,擴大了快速本地 AI 代理的生態系統。

參考文獻

  1. Gromov, A., Tirumala, K., Shapourian, H., Glorioso, P., & Roberts, D. A. (2025). The unreasonable ineffectiveness of the deeper layers(深層的不可思議低效)。ICLR 2025 海報發表。https://arxiv.org/abs/2403.17887

效能聲明 – 基準測試於 Intel Core Ultra 7 268V(2.20 GHz)搭配整合式 Arc 140V GPU 及 32 GB DDR5,使用 OpenVINO 2025.2 進行。不同配置下的結果可能有所差異。

Sources