sudoingX/qwen38-mtp
One llama.cpp flag unlocks +33-39% decode speed for Qwen3.8-27B on consumer GPUs. The MTP head already ships inside your GGUF. Recipe, paired benchmarks, probe tool.
Qwen3.8‑27B MTP – llama.cpp에서 커뮤니티가 발견한 속도 향상
무엇인가요
- llama.cpp용 명령줄 플래그 세트로, GGUF 형식으로 배포된 Qwen‑3.8‑27B 모델에 대해 예측적 다중 토큰 예측(MTP) 디코딩을 활성화합니다.
--spec-type draft-mtp --spec-draft-n-max 2 --parallel 1조합은 모델 변환이나 커스텀 빌드 없이도 소비자급 GPU에서 33 %–145 % 빠른 생성 속도를 제공합니다.
왜 중요한가요
- 속도 향상은 draft‑MTP 에 기인합니다. 서버는 먼저 가벼운 헤드로 여러 토큰을 드래프트하고, 검증에 실패한 토큰만 전체 모델을 실행합니다. 이로 인해 고비용 순전파 횟수가 감소합니다.
- 커뮤니티는 53가지의 다양한 하드웨어 구성(2016년 Pascal GPU부터 2026년 Blackwell 카드, Apple Silicon, 심지어 해제된 마이닝 카드까지)을 조사하고, 사용자가 자신의 시스템에서 동일한 성능 향상을 재현할 수 있도록 7가지 실용적인 튜닝 규칙을 도출했습니다.
사용 방법
- GGUF 다운로드: Qwen‑3.8‑27B (예:
unsloth/Qwen3.8‑27B‑GGUF) - 참조 명령어 실행 (필요시
-c를 컨텍스트 길이에 맞게 조정):llama-server -m Qwen3.8-27B-Q4_K_M.gguf \ -c 131072 -ngl 999 -fa 1 \ --cache-type-k q4_0 --cache-type-v q4_0 \ --spec-type draft-mtp --spec-draft-n-max 2 --parallel 1 - 튜닝:
--spec-draft-n-max(2–4)를 스위프하여 GPU에 최적화된 값을 찾습니다.- 대역폭 제한된 시스템에서는
--spec-draft-p-min 0.60‑0.75를 시도해 보세요. - 멀티 GPU 환경에서는 spec 플래그를 적용하기 전에
--split-mode tensor를 설정하세요. - 항상
--parallel 1로 벤치마크를 수행하세요 (다수의 동시 스트림에서는 spec 이점이 사라집니다).
- 효과 측정: 제공된
probe.py스크립트로 서버에서 토큰을 스트리밍하고 프롬프트당 중앙값 속도를 보고합니다.
커뮤니티 데이터에서 도출된 핵심 통찰
- GPU 클래스가 중요합니다: 24 GB 카드(RTX 3090/4090)는 일반적으로
n‑max = 2에서 최고 성능을 발휘하지만, 더 신형이고 빠른 카드(RTX 5090, Blackwell)는n‑max = 4‑6까지 가능합니다. - 스플릿 모드(
layer대tensor)는 이중 GPU 쌍에서 추가로 +68 % 의 성능 향상을 제공할 수 있습니다. - 병렬성: spec 속도 향상은 싱글 스트림 최적화입니다.
--parallel 4를 사용하면 이점이 사라집니다. - 메모리 압박: 공유 데스크톱 환경에서는 OS가 가중치를 호스트 RAM으로 스왑하여 속도가 절반으로 줄어듭니다. 헤드리스로 실행하거나 전체 모델이 메모리에 상주하는지 확인하세요 (
mem_info_gtt_used또는 벤더 고유 도구 사용). - 베이스라인 대 spec: 53개의 보고된 카드에서 성능 향상은 보통 (+30 %)에서 극단적 (+180 %)까지 다양하며, 특히 대규모 컨텍스트 창(256 K 토큰)에서는 전체 전파의 오버헤드가 지배적이 되어 효과가 두드러집니다.
누가 이득을 보나요
- llama.cpp로 로컬에서 Qwen‑3.8‑27B를 실행하는 연구자, 애호가, 또는 AI 기반 앱 개발자로서, 새로운 하드웨어를 구매하지 않고도 더 빠른 생성 속도를 원하는 사람.
- 이 리포지토리는 살아있는 벤치마크 컬렉션으로도 기능하며, 기여자는 자신의 측정 결과를 PR로 제출하여 새 행을 추가할 수 있습니다.
주의사항
- 속도 향상은 싱글 스트림 디코딩에서 측정되었습니다. 멀티유저 서버에서는 동일한 개선을 기대할 수 없습니다.
- 프롬프트 임베딩 전송에 약간의 오버헤드가 발생합니다.
- 결과는 드라이버 버전, 온도, 정확한 llama.cpp 빌드에 따라 달라지므로, 튜닝 전에 llama.cpp를 재빌드하는 것이 권장됩니다.
TL;DR: llama.cpp에서 draft‑mtp 예측 디코딩 플래그를 활성화함으로써 커뮤니티는 Qwen‑3.8‑27B GGUF를 다양한 GPU에서 훨씬 더 빠르게 만들었으며, 재현을 위해 필요한 정확한 플래그 조합, 튜닝 규칙, 벤치마크 데이터를 리포지토리에 기록했습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트