sudoingX/qwen38-mtp

One llama.cpp flag unlocks +33-39% decode speed for Qwen3.8-27B on consumer GPUs. The MTP head already ships inside your GGUF. Recipe, paired benchmarks, probe tool.

Qwen3.8‑27B MTP – llama.cpp에서 커뮤니티가 발견한 속도 향상

무엇인가요

  • llama.cpp용 명령줄 플래그 세트로, GGUF 형식으로 배포된 Qwen‑3.8‑27B 모델에 대해 예측적 다중 토큰 예측(MTP) 디코딩을 활성화합니다. --spec-type draft-mtp --spec-draft-n-max 2 --parallel 1 조합은 모델 변환이나 커스텀 빌드 없이도 소비자급 GPU에서 33 %–145 % 빠른 생성 속도를 제공합니다.

왜 중요한가요

  • 속도 향상은 draft‑MTP 에 기인합니다. 서버는 먼저 가벼운 헤드로 여러 토큰을 드래프트하고, 검증에 실패한 토큰만 전체 모델을 실행합니다. 이로 인해 고비용 순전파 횟수가 감소합니다.
  • 커뮤니티는 53가지의 다양한 하드웨어 구성(2016년 Pascal GPU부터 2026년 Blackwell 카드, Apple Silicon, 심지어 해제된 마이닝 카드까지)을 조사하고, 사용자가 자신의 시스템에서 동일한 성능 향상을 재현할 수 있도록 7가지 실용적인 튜닝 규칙을 도출했습니다.

사용 방법

  1. GGUF 다운로드: Qwen‑3.8‑27B (예: unsloth/Qwen3.8‑27B‑GGUF)
  2. 참조 명령어 실행 (필요시 -c를 컨텍스트 길이에 맞게 조정):
    llama-server -m Qwen3.8-27B-Q4_K_M.gguf \
      -c 131072 -ngl 999 -fa 1 \
      --cache-type-k q4_0 --cache-type-v q4_0 \
      --spec-type draft-mtp --spec-draft-n-max 2 --parallel 1
    
  3. 튜닝:
    • --spec-draft-n-max (2–4)를 스위프하여 GPU에 최적화된 값을 찾습니다.
    • 대역폭 제한된 시스템에서는 --spec-draft-p-min 0.60‑0.75를 시도해 보세요.
    • 멀티 GPU 환경에서는 spec 플래그를 적용하기 전에 --split-mode tensor를 설정하세요.
    • 항상 --parallel 1로 벤치마크를 수행하세요 (다수의 동시 스트림에서는 spec 이점이 사라집니다).
  4. 효과 측정: 제공된 probe.py 스크립트로 서버에서 토큰을 스트리밍하고 프롬프트당 중앙값 속도를 보고합니다.

커뮤니티 데이터에서 도출된 핵심 통찰

  • GPU 클래스가 중요합니다: 24 GB 카드(RTX 3090/4090)는 일반적으로 n‑max = 2에서 최고 성능을 발휘하지만, 더 신형이고 빠른 카드(RTX 5090, Blackwell)는 n‑max = 4‑6까지 가능합니다.
  • 스플릿 모드(layertensor)는 이중 GPU 쌍에서 추가로 +68 % 의 성능 향상을 제공할 수 있습니다.
  • 병렬성: spec 속도 향상은 싱글 스트림 최적화입니다. --parallel 4를 사용하면 이점이 사라집니다.
  • 메모리 압박: 공유 데스크톱 환경에서는 OS가 가중치를 호스트 RAM으로 스왑하여 속도가 절반으로 줄어듭니다. 헤드리스로 실행하거나 전체 모델이 메모리에 상주하는지 확인하세요 (mem_info_gtt_used 또는 벤더 고유 도구 사용).
  • 베이스라인 대 spec: 53개의 보고된 카드에서 성능 향상은 보통 (+30 %)에서 극단적 (+180 %)까지 다양하며, 특히 대규모 컨텍스트 창(256 K 토큰)에서는 전체 전파의 오버헤드가 지배적이 되어 효과가 두드러집니다.

누가 이득을 보나요

  • llama.cpp로 로컬에서 Qwen‑3.8‑27B를 실행하는 연구자, 애호가, 또는 AI 기반 앱 개발자로서, 새로운 하드웨어를 구매하지 않고도 더 빠른 생성 속도를 원하는 사람.
  • 이 리포지토리는 살아있는 벤치마크 컬렉션으로도 기능하며, 기여자는 자신의 측정 결과를 PR로 제출하여 새 행을 추가할 수 있습니다.

주의사항

  • 속도 향상은 싱글 스트림 디코딩에서 측정되었습니다. 멀티유저 서버에서는 동일한 개선을 기대할 수 없습니다.
  • 프롬프트 임베딩 전송에 약간의 오버헤드가 발생합니다.
  • 결과는 드라이버 버전, 온도, 정확한 llama.cpp 빌드에 따라 달라지므로, 튜닝 전에 llama.cpp를 재빌드하는 것이 권장됩니다.

TL;DR: llama.cpp에서 draft‑mtp 예측 디코딩 플래그를 활성화함으로써 커뮤니티는 Qwen‑3.8‑27B GGUF를 다양한 GPU에서 훨씬 더 빠르게 만들었으며, 재현을 위해 필요한 정확한 플래그 조합, 튜닝 규칙, 벤치마크 데이터를 리포지토리에 기록했습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트