Qwen3.8 27B 양자화 벤치마크: 4비트는 BF16과 동일, 1비트는 실패

TL;DR

Qwen3.8 27B를 4비트(Q4_K_M, 17 GB)로 양자화하면 전체 BF16 모델과 거의 동일한 벤치마크 점수를 기록하며, 24 GB GPU에 여유롭게 적재 가능하다. 4비트 이하의 양자화는 성능을 저하시키며, 1비트(UD‑IQ1_S, 6.2 GB)는 GPQA 다이아몬드에서 무작위 추측 수준으로 떨어지고 코딩 작업에서는 실패한다.


4비트 양자화는 성능을 유지한다

결론: 4비트 Q4_K_M 양자화(17 GB)는 GPQA 다이아몬드, IFBench, Terminal‑Bench 2.1에서 BF16과 동일한 성능을 보이며, 소비자용 GPU에 최적의 선택이다.

  • 전체 BF16 모델은 약 55 GB VRAM을 필요로 하며, 대부분의 데스크톱 카드를 초과한다.
  • Q4_K_M는 RTX 4090(24 GB)에서 실행되며 약 64k 토큰의 KV‑캐시를 남긴다.
  • GPQA 다이아몬드에서 BF16, 8비트, 4비트, 심지어 2비트의 점수는 통계적으로 구분되지 않는다(윌슨 95 % 신뢰구간이 겹침). 유일하게 2비트 UD‑Q2_K_XL만 약간의 하락을 보였다.
  • IFBench에서는 BF16과 2비트 모델 간에 측정 가능한 차이가 없으며, 다만 컨텍스트 창은 약 4 k 토큰으로 제한된다.
  • Terminal‑Bench 2.1(89개의 에이전트형 코딩 작업, 3시간 타임아웃, xhigh 노력 수준, 98 k 컨텍스트)에서는 BF16과 Q4_K_M의 성공률이 동일하다. 2비트 모델은 약간 떨어지지만, 중급 상용 에이전트(예: Opus 4.7, Gemini 3.1 Pro) 수준과 비교 가능하다.

“17 GB의 Q4_K_M는 인기 있는 에이전트형 코딩 벤치마크인 Terminal‑Bench 2.1에서 전체 모델과 동일한 성능을 보입니다. RTX 4090과 같은 24 GB 카드에 적재되며, 약 64k 토큰의 컨텍스트를 여유롭게 유지할 수 있습니다.” – Quesma 블로그

왜 4비트가 효과적인가

  • 양자화 방법 Q4_K_M(Unsloth v2)는 단순한 4비트 방식보다 가중치 분포를 더 잘 보존한다.
  • 저자께서는 고정된 F16 KV‑캐시(약 32 k 토큰당 2.3 GB)를 사용했기 때문에 메모리 절약은 가중치 압축에서만 발생한다.
  • 더 높은 추론 노력(xhigh)이 양자화로 인한 미세한 확률 변화를 상쇄하며, 커뮤니티의 의견에서도 이를 언급했다.

2비트 양자화는 사용 가능하지만 약하다

결론: 2비트 UD‑Q2_K_XL(10.7 GB)는 대부분의 벤치마크에서 기능은 하지만 약간의 성능 저하가 발생한다.

  • GPQA 다이아몬드 점수는 4비트보다 약간 하락한다.
  • IFBench에서는 여전히 유의미한 하락이 없어, 많은 지시 따르기 작업이 2비트 노이즈에 관대함을 시사한다.
  • Terminal‑Bench 2.1에서는 성공률이 몇 포인트 떨어지지만, 이전 상용 에이전트 수준과 비교 가능하다.
  • 토큰 사용량 증가: 해결된 작업에서 2비트 모델은 BF16보다 약 25 % 더 많은 토큰을 생성하지만, 추론 턴 수는 거의 동일하게 유지된다.

1비트 양자화는 붕괴된다

결론: 1비트 UD‑IQ1_S(6.2 GB)는 극도로 실패하며, GPQA 다이아몬드에서는 무작위 추측 수준에 가까워지고 코딩 벤치마크에서도 성능이 매우 낮다.

  • 점수는 무작위 추측 기준선 아래로 떨어지며, 특히 더 높은 추론 노력(xhigh)에서는 긴 생성으로 인해 빈 응답이 발생한다.
  • 저자 측 측정 결과는 Unsloth의 "72 % 상위 1위 정확도" 주장과 모순되며, 누락된 28 %는 작업 성공에 결정적이다.
  • 커뮤니티 보고(예: r/LocalLLaMA)는 동일한 실패 패턴을 확인하며, 모델을 "뇌 손상 양자화"라고 묘사한다.

“2비트 양자화는 어느 정도 작동하지만, 최고의 1비트 모델도 이 벤치마크에서는 무용지물입니다.” – Quesma 블로그

기술적 통찰

  • 사전 훈련된 밀집 모델에 1비트 양자화는 본질적으로 불안정하다. 막대한 데이터에서 양자화 인식 훈련(QAT) 없이 가중치 표현이 붕괴된다.
  • 한 커뮤니티 멤버의 지적처럼, “기존 사전 훈련된 모델에 양자화를 적용하면 거의 항상 1비트에서 붕괴된다.” (HN 댓글)

벤치마크 방법론

결론: 저자는 양자화 테스트 전에 공식 BF16 점수를 재현하여 신뢰할 수 있는 기준점을 확보했다.

  • 사용한 벤치마크: GPQA 다이아몬드(대학 수준 과학 QA), IFBench(지시 따르기), Terminal‑Bench 2.1(에이전트형 코딩).
  • 추론 노력 수준: low, medium, xhigh(기본값). 더 높은 노력은 일반적으로 점수를 향상시키지만 토큰 소비도 증가한다.
  • 하드웨어: NVIDIA L40S(48 GB), H100(80 GB), H200(141 GB). 모달 GPU 대여를 사용했으며, 전체 벤치마크에 약 $3 k 비용이 들었다.
  • 모델 로딩은 llama.cpp(2026년 8월 16일 빌드)를 사용했으며, 가중치 양자화와 관계없이 F16 KV‑캐시를 사용했다.
  • 표시된 신뢰구간은 윌슨 95 % 구간이며, HN의 한 댓글에서 이는 보수적이고 런-투-런 변동과 직접적인 관련이 없다고 설명했다.

커뮤니티의 시각

결론: 커뮤니티 멤버들은 주요 결과를 대부분 확인하며, 추론 노력의 중요성에 대해 보완 정보를 제공하고, KV‑캐시 양자화 및 GPU 메모리 한계에 대한 질문을 제기한다.

  • 추론 노력의 중요성: 한 커뮤니티 멤버는 더 긴 사고가 양자화 노이즈를 상쇄할 수 있지만, 더 많은 토큰 소비를 수반한다고 지적했다.
  • GPU 메모리 한계: 사용자들은 4비트 모델이 긴 컨텍스트에서는 여전히 16 GB 카드의 용량을 초과함을 지적하며, 3비트 또는 혼합 정밀도 방식이 이 공백을 메울 수 있다고 제안한다.
  • KV‑캐시 양자화: 모델 양자화, KV‑캐시 양자화, 컨텍스트 크기의 조합 벤치마크를 요청하며, 아직 탐색되지 않은 영역임을 강조한다.
  • 하드웨어 현실성: 여러 댓글은 많은 소비자가 8~12 GB GPU를 보유하고 있으며, 이들 환경에서는 4비트 모델도 유용한 컨텍스트 길이를 유지하기 어렵다고 지적한다.

비용 고려사항

결론: 클라우드 GPU에서 전체 규모의 벤치마크를 실행하는 것은 비용이 크며, 4비트 양자화는 메모리와 계산 비용을 줄이지만, 대규모 MoE 모델의 API 가격과 비교하면 절감 효과는 제한적이다.

  • 모달 GPU 대여를 사용했으며, 총 지출 약 $3 000.
  • 참고로, DeepSeek V4 Flash 0731(284 B MoE)은 OpenRouter에서 출력 토큰 100만 개당 약 $0.10로, 로컬에서 밀집형 27 B 모델을 실행하는 것보다 훨씬 저렴하다.
  • 4비트의 메모리 절약(약 38 GB 대비 55 GB)은 단일 RTX 4090에서 실행 가능하게 하여 멀티 GPU 설정을 피할 수 있다.

실용적 권장사항

결론: 대부분의 로컬 작업에는 4비트 Q4_K_M 양자화를 사용할 것; 2비트는 저자원 환경에 적합; 1비트는 완전히 피할 것.

  1. GPU에 맞는 가장 높은 양자화 수준을 선택하되, 컨텍스트 창에 필요한 KV‑캐시 크기를 유지할 것.
  2. 소량의 정확도 하락이 보일 경우 추론 노력 수준을 xhigh로 설정할 것; 더 많은 토큰 사용을 예상할 것.
  3. KV‑캐시 메모리 모니터링 – 4비트 모델이라도 32 k 토큰 캐시는 약 2.3 GB 소비; 긴 컨텍스트는 더 큰 GPU 필요.
  4. 16 GB 카드에서 64k 이상 토큰을 필요로 할 경우, 이 벤치마크에서 다루지 않은 혼합 정밀도 또는 3비트 방식을 고려할 것.
  5. 양자화 인식 훈련을 막대한 데이터셋에서 수행하지 않는 한, 1비트 양자화는 피할 것 – 현재 대부분의 사용자에게는 실용적이지 않다.

최종 생각

Qwen3.8 27B의 양자화는 4비트까지 실용적으로 안전하며, 다양한 작업에서 BF16 수준의 품질을 제공하면서도 소비자용 GPU에 적재 가능하다. 성능 곡선은 비선형적이다: BF16에서 4비트까지는 거의 변화 없으며, 2비트에서는 약간 하락하고, 1비트에서는 치명적인 붕괴가 발생한다. 특히 잘 설계된 Q4_K_M 버전을 포함한 양자화를 수용함으로써, 능력을 희생하지 않고도 대규모 언어 모델을 로컬에서 배포할 수 있다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch