Intel Core Ultra에서 깊이‑프루닝된 초안 모델을 사용한 Qwen3-8B 가속화
TL;DR
Intel® Core™ Ultra에서 추측 디코딩과 깊이‑프루닝된 Qwen3‑0.6B 초안을 사용하여 가속화된 Qwen3-8B는 약 1.4× 속도 향상을 달성하여 🤗 smolagents를 통해 빠른 로컬 AI 에이전트를 가능하게 합니다.
Qwen3‑8B: 에이전시 워크플로를 위해 설계된 모델
Qwen3‑8B는 도구 호출, 다단계 추론, 장기 컨텍스트 처리와 같은 네이티브 에이전시 행동을 포함하는 Qwen 계열의 최신 릴리스입니다. 이러한 기능은 LLM이 "생각을 소리 내어" 추적 및 중간 단계를 생성해야 하는 AI‑PC (AIPC) 시나리오에 자연스럽게 맞으며, 이는 토큰 사용량을 증가시키고 높은 추론 처리량을 요구합니다. 🤗 smolagents, QwenAgent, AutoGen과 같은 에이전트 프레임워크와 결합하면 Qwen3‑8B는 API 호출, 코드 작성, 복잡한 추론 수행 등 다양한 애플리케이션을 구동할 수 있습니다.
Intel® Core™ Ultra에서 추측 디코딩을 활용한 Qwen3‑8B 가속화
추측 디코딩(arXiv:2211.17192 참조)은 작은 초안 모델이 한 번의 포워드 패스에서 여러 토큰을 제안하고, 큰 대상 모델이 이를 검증하도록 함으로써 자동 회귀 생성 속도를 높입니다. Intel Core Ultra 벤치마크에서:
- 대상 모델 – OpenVINO (OpenVINO 2025.2)로 INT4 양자화된 Qwen3‑8B.
- 초안 모델 – OpenVINO로 INT8 양자화된 Qwen3‑0.6B.
- 하드웨어 – Core Ultra 7 268V에 통합된 Intel Lunar Lake GPU (Arc 140V), 32 GB DDR5.
이 구성은 기본 4‑bit OpenVINO 추론 대비 평균 1.3× 속도 향상을 제공했습니다.
from openvino_genai import LLMPipeline, draft_model
target_path = "/path/to/target/Qwen3-8B-int4-ov"
draft_path = "/path/to/draft/Qwen3-0.6B-int8-ov"
device = "GPU"
model = LLMPipeline(target_path, device,
draft_model=draft_model(draft_path, device))
streamer = lambda x: print(x, end="", flush=True)
model.generate(
"What is speculative decoding and how does it improve inference speed?",
max_new_tokens=100,
streamer=streamer,
)
Note: 대상 모델과 초안 모델 모두 OpenVINO 형식으로 변환되어야 합니다. 사전 변환된 모델은 블로그 게시물의 링크에서 제공되며, OpenVINO 내보내기 가이드를 따라 직접 변환할 수도 있습니다.
깊이‑프루닝된 초안 모델으로 성능 한계 돌파
추측 디코딩의 이론적 속도 향상은
$$ \text{Speedup}=\frac{E[#\text{generated tokens}]}{\gamma c + 1}, $$
여기서 (\gamma)는 대상 모델이 단계당 생성하는 평균 토큰 수, (c)는 대상과 초안 사이의 지연 비율이며, 분자는 추측 윈도우당 기대 토큰 수를 나타냅니다. 초안 지연을 낮추면((c) 감소) 전체 속도가 개선됩니다.
초안 모델의 레이어‑와이즈 프루닝
최근 연구에 따르면 모델 깊이가 추론 지연을 지배합니다. 레이어‑와이즈 압축 연구에서 영감을 받아, 저자들은 레이어 출력 간 각도 거리를 측정해 영향력이 낮은 블록을 식별하고 제거했습니다. Qwen3‑0.6B의 28개 레이어 중 6개를 프루닝했으며, 이후 초안 모델을 Qwen3‑8B가 생성한 500 k 프롬프트(BAAI/Infinity‑Instruct 데이터셋)로 합성 데이터에 미세조정했습니다.
얻어진 성과
깊이‑프루닝된 초안 모델(OpenVINO/Qwen3-pruned-6L-from-0.6B-int8-ov)은 기본 대비 추측 디코딩 속도 향상을 **~1.4×**까지 끌어올렸으며, 더 빠른 초안이 전체 처리량을 높인다는 기대를 확인했습니다.
전체 과정을 재현한 노트북은 게시물에 링크되어 있습니다: https://github.com/openvinotoolkit/openvino_notebooks/blob/latest/supplementary_materials/notebooks/qwen-3/qwen3.ipynb.
🤗 smolagents와의 통합
실제 영향을 보여주기 위해, 가속화된 Qwen3‑8B와 프루닝된 초안 조합을 🤗 smolagents 라이브러리에 통합했습니다. 이제 개발자는 다음과 같은 로컬 AI 에이전트를 인스턴스화할 수 있습니다:
- 외부 도구 호출(예: 웹 검색).
- Python 코드 실행(예:
python-pptx를 이용한 PowerPoint 슬라이드 생성). - Intel Core Ultra 하드웨어에서 장기 컨텍스트 추론을 효율적으로 처리.
데모 작업에서는 에이전트에게 Qwen3 시리즈의 주요 특징을 요약하고 슬라이드 덱을 생성하도록 요청했습니다. 워크플로는 웹 검색 도구와 Python 인터프리터를 결합했으며, 가속된 에이전시 모델이 소비자 급 하드웨어에서 엔드‑투‑엔드 AI 애플리케이션을 가능하게 함을 보여줍니다.
같은 모델 조합은 AutoGen이나 QwenAgent와 같은 다른 에이전트 프레임워크에서도 사용할 수 있어, 빠른 로컬 AI 에이전트를 위한 생태계를 확장합니다.
References
- Gromov, A., Tirumala, K., Shapourian, H., Glorioso, P., & Roberts, D. A. (2025). 깊은 레이어의 비합리적인 비효율성. ICLR 2025 포스터. https://arxiv.org/abs/2403.17887
Performance disclaimer – 벤치마크는 OpenVINO 2025.2를 사용해 Intel Core Ultra 7 268V(2.20 GHz)와 통합 Arc 140V GPU, 32 GB DDR5 환경에서 수행되었습니다. 결과는 구성에 따라 달라질 수 있습니다.