在 Intel Core Ultra 上使用深度裁剪草稿模型加速 Qwen3-8B

TL;DR

在 Intel® Core™ Ultra 上通过推测解码和深度裁剪的 Qwen3‑0.6B 草稿模型加速 Qwen3-8B,可实现约 1.4 倍的加速,从而通过 🤗 smolagents 启用快速本地 AI 代理。

Qwen3‑8B:为代理工作流构建的模型

Qwen3‑8B 是 Qwen 系列的最新发布,具备原生的代理行为,如工具调用、多步推理和长上下文处理。这些能力使其自然适用于 AI‑PC(AIPC)场景,在这些场景中,LLM 必须生成“思考过程”痕迹和中间步骤,这会增加 token 使用量并需要高推理吞吐量。当与 🤗 smolagents、QwenAgent 或 AutoGen 等代理框架配合使用时,Qwen3‑8B 能够驱动调用 API、编写代码和进行复杂推理的应用。

在 Intel® Core™ Ultra 上通过推测解码加速 Qwen3‑8B

推测解码(参见 arXiv:2211.17192)通过让较小的草稿模型在一次前向传播中提出多个 token,从而加速自回归生成,随后由更大的目标模型进行验证。在 Intel Core Ultra 基准测试中:

  • Target model – Qwen3‑8B 量化为 INT4,使用 OpenVINO(OpenVINO 2025.2)。
  • Draft model – Qwen3‑0.6B 量化为 INT8,使用 OpenVINO。
  • Hardware – Intel Lunar Lake 集成 GPU(Arc 140V),运行在 Core Ultra 7 268V,32 GB DDR5。

该配置相较于基线 4 位 OpenVINO 推理实现了平均 1.3× 加速

from openvino_genai import LLMPipeline, draft_model

target_path = "/path/to/target/Qwen3-8B-int4-ov"
draft_path  = "/path/to/draft/Qwen3-0.6B-int8-ov"
device = "GPU"

model = LLMPipeline(target_path, device,
                    draft_model=draft_model(draft_path, device))

streamer = lambda x: print(x, end="", flush=True)
model.generate(
    "What is speculative decoding and how does it improve inference speed?",
    max_new_tokens=100,
    streamer=streamer,
)

注意: 目标模型和草稿模型都必须转换为 OpenVINO 格式。预先转换的模型可从博客文章中的链接获取,或者您可以遵循 OpenVINO 导出指南。

通过深度裁剪草稿模型进一步提升性能

推测解码的理论加速比为

$$ \text{Speedup}=\frac{E[#\text{generated tokens}]}{\gamma c + 1}, $$

其中 (\gamma) 是目标模型每步生成的平均 token 数,(c) 是目标模型与草稿模型之间的延迟比率,分子反映了每个推测窗口预期产生的 token 数。降低草稿模型的延迟(即降低 (c))因此可以提升整体速度。

草稿模型的层级裁剪

最新研究表明模型深度是推理延迟的主要因素。受层级压缩研究的启发,作者测量了层输出之间的角度距离,以识别低影响的块并将其移除。Qwen3‑0.6B 的 28 层中有 6 层被裁剪,随后在由 Qwen3‑8B 基于 BAAI/Infinity‑Instruct 数据集的 50 万条提示生成的合成数据上对草稿模型进行微调。

获得的收益

深度裁剪的草稿模型(可在 OpenVINO/Qwen3-pruned-6L-from-0.6B-int8-ov 中获取)将推测解码的加速比提升至 ~1.4×,相较于基线,验证了更快的草稿模型能够带来更高整体吞吐量的预期。

完整复现这些步骤的 notebook 已在文章中链接:https://github.com/openvinotoolkit/openvino_notebooks/blob/latest/supplementary_materials/notebooks/qwen-3/qwen3.ipynb

与 🤗 smolagents 的集成

为了展示实际影响,加速的 Qwen3‑8B 与裁剪草稿模型组合已集成到 🤗 smolagents 库中。开发者现在可以实例化本地 AI 代理,实现:

  1. 调用外部工具(例如网页搜索)。
  2. 执行 Python 代码(例如使用 python-pptx 生成 PowerPoint 幻灯片)。
  3. 在 Intel Core Ultra 硬件上高效处理长上下文推理。

演示任务要求代理 总结 Qwen3 系列的关键特性并生成幻灯片。工作流结合了网页搜索工具和 Python 解释器,展示了加速的代理模型如何在消费级硬件上实现端到端 AI 应用。

相同的模型组合也可用于 AutoGen 或 QwenAgent 等其他代理框架,进一步拓宽了快速本地 AI 代理的生态系统。

参考文献

  1. Gromov, A., Tirumala, K., Shapourian, H., Glorioso, P., & Roberts, D. A. (2025). The unreasonable ineffectiveness of the deeper layers. 在 ICLR 2025 上展示的海报。 https://arxiv.org/abs/2403.17887

性能免责声明 – 基准测试在 Intel Core Ultra 7 268V(2.20 GHz)配备集成 Arc 140V GPU 和 32 GB DDR5 的环境下使用 OpenVINO 2025.2 进行。不同配置下的结果可能有所差异。

Sources