在 Intel Core Ultra 上使用深度裁剪草稿模型加速 Qwen3-8B
TL;DR
在 Intel® Core™ Ultra 上通过推测解码和深度裁剪的 Qwen3‑0.6B 草稿模型加速 Qwen3-8B,可实现约 1.4 倍的加速,从而通过 🤗 smolagents 启用快速本地 AI 代理。
Qwen3‑8B:为代理工作流构建的模型
Qwen3‑8B 是 Qwen 系列的最新发布,具备原生的代理行为,如工具调用、多步推理和长上下文处理。这些能力使其自然适用于 AI‑PC(AIPC)场景,在这些场景中,LLM 必须生成“思考过程”痕迹和中间步骤,这会增加 token 使用量并需要高推理吞吐量。当与 🤗 smolagents、QwenAgent 或 AutoGen 等代理框架配合使用时,Qwen3‑8B 能够驱动调用 API、编写代码和进行复杂推理的应用。
在 Intel® Core™ Ultra 上通过推测解码加速 Qwen3‑8B
推测解码(参见 arXiv:2211.17192)通过让较小的草稿模型在一次前向传播中提出多个 token,从而加速自回归生成,随后由更大的目标模型进行验证。在 Intel Core Ultra 基准测试中:
- Target model – Qwen3‑8B 量化为 INT4,使用 OpenVINO(OpenVINO 2025.2)。
- Draft model – Qwen3‑0.6B 量化为 INT8,使用 OpenVINO。
- Hardware – Intel Lunar Lake 集成 GPU(Arc 140V),运行在 Core Ultra 7 268V,32 GB DDR5。
该配置相较于基线 4 位 OpenVINO 推理实现了平均 1.3× 加速。
from openvino_genai import LLMPipeline, draft_model
target_path = "/path/to/target/Qwen3-8B-int4-ov"
draft_path = "/path/to/draft/Qwen3-0.6B-int8-ov"
device = "GPU"
model = LLMPipeline(target_path, device,
draft_model=draft_model(draft_path, device))
streamer = lambda x: print(x, end="", flush=True)
model.generate(
"What is speculative decoding and how does it improve inference speed?",
max_new_tokens=100,
streamer=streamer,
)
注意: 目标模型和草稿模型都必须转换为 OpenVINO 格式。预先转换的模型可从博客文章中的链接获取,或者您可以遵循 OpenVINO 导出指南。
通过深度裁剪草稿模型进一步提升性能
推测解码的理论加速比为
$$ \text{Speedup}=\frac{E[#\text{generated tokens}]}{\gamma c + 1}, $$
其中 (\gamma) 是目标模型每步生成的平均 token 数,(c) 是目标模型与草稿模型之间的延迟比率,分子反映了每个推测窗口预期产生的 token 数。降低草稿模型的延迟(即降低 (c))因此可以提升整体速度。
草稿模型的层级裁剪
最新研究表明模型深度是推理延迟的主要因素。受层级压缩研究的启发,作者测量了层输出之间的角度距离,以识别低影响的块并将其移除。Qwen3‑0.6B 的 28 层中有 6 层被裁剪,随后在由 Qwen3‑8B 基于 BAAI/Infinity‑Instruct 数据集的 50 万条提示生成的合成数据上对草稿模型进行微调。
获得的收益
深度裁剪的草稿模型(可在 OpenVINO/Qwen3-pruned-6L-from-0.6B-int8-ov 中获取)将推测解码的加速比提升至 ~1.4×,相较于基线,验证了更快的草稿模型能够带来更高整体吞吐量的预期。
完整复现这些步骤的 notebook 已在文章中链接:https://github.com/openvinotoolkit/openvino_notebooks/blob/latest/supplementary_materials/notebooks/qwen-3/qwen3.ipynb。
与 🤗 smolagents 的集成
为了展示实际影响,加速的 Qwen3‑8B 与裁剪草稿模型组合已集成到 🤗 smolagents 库中。开发者现在可以实例化本地 AI 代理,实现:
- 调用外部工具(例如网页搜索)。
- 执行 Python 代码(例如使用
python-pptx生成 PowerPoint 幻灯片)。 - 在 Intel Core Ultra 硬件上高效处理长上下文推理。
演示任务要求代理 总结 Qwen3 系列的关键特性并生成幻灯片。工作流结合了网页搜索工具和 Python 解释器,展示了加速的代理模型如何在消费级硬件上实现端到端 AI 应用。
相同的模型组合也可用于 AutoGen 或 QwenAgent 等其他代理框架,进一步拓宽了快速本地 AI 代理的生态系统。
参考文献
- Gromov, A., Tirumala, K., Shapourian, H., Glorioso, P., & Roberts, D. A. (2025). The unreasonable ineffectiveness of the deeper layers. 在 ICLR 2025 上展示的海报。 https://arxiv.org/abs/2403.17887
性能免责声明 – 基准测试在 Intel Core Ultra 7 268V(2.20 GHz)配备集成 Arc 140V GPU 和 32 GB DDR5 的环境下使用 OpenVINO 2025.2 进行。不同配置下的结果可能有所差异。