Unsloth Dynamic 3.0 GGUF 출시
Unsloth Dynamic 3.0은 동일한 크기에서 더 높은 정확도를 제공합니다
Unsloth Dynamic v3.0은 Dynamic v2.0에 비해 대폭 업그레이드되었으며, 특히 동일한 디스크 점유 공간을 유지하면서 모델 품질을 더 많이 보존하도록 설계되었습니다. Qwen3.8-27B 모델의 경우, Dynamic 3.0 양자화 모델(quants)은 동일한 크기의 다른 모든 제공업체보다 top-1% 정확도가 10% 이상 더 높습니다. 이 GGUF 파일들은 llama.cpp 및 Unsloth Desktop을 포함한 대부분의 추론 엔진과 호환됩니다.
Dynamic 3.0의 주요 기술적 개선 사항
Dynamic 3.0은 사후 학습 양자화(PTQ)에서의 몇 가지 방법론적 변화를 통해 성능 향상을 달성했습니다:
- 고품질 보정 데이터셋: Unsloth는 이제 다양한 출처에서 수집된 정제된 imatrix 보정 데이터셋을 활용하며, 특히 다국어 성능, 채팅, 에이전트 코딩에 최적화되어 있습니다.
- 향상된 레이어 선택: 품질 보존을 극대화하기 위해 어떤 레이어를 양자화할지, 그리고 어떻게 할지에 대한 프로세스가 개선되었습니다.
- 순수 PTQ 방식: Unsloth는 Quantization Aware Training (QAT)이나 Quantization Aware Distillation (QAD)를 명시적으로 사용하지 않으며, imatrix 보정 데이터셋으로 학습하지도 않습니다. 이 방식은 QAD/QAT 방식에 비해 과적합(overfitting)의 위험을 줄여줍니다.
모델별 최적화 및 크기 감소
디스크 공간과 성능을 최적화하기 위해, Unsloth는 Qwen3.8-27B 양자화 모델에 대해 다음과 같은 특정 변경 사항을 적용했습니다:
- MTP 모듈 제거:
UD-Q2_K_XL(8.37GB 이하)보다 작은 양자화 모델의 경우, 약 500MB의 디스크 공간을 절약하기 위해 MTP 모듈을 제거했습니다. MTP가 필요한 사용자는 별도의Q4_0MTP 모듈을 여전히 사용할 수 있습니다. - 극한의 압축:
UD-IQ1_S양자화 모델은 6.2GB(MTP 제외)이며, 전체 모델보다 89% 더 작으면서도 약 72%의 top-1% 정확도를 유지합니다. - 개선된 저비트 성능:
UD-Q2_K_XL양자화 모델(9.83GB)은 차세대 대안 모델보다 top-1% 정확도가 약 8% 더 높으며, 이전에 실패했던 작동 가능한 HTML 프로그램을 생성하는 능력을 입증했습니다.
벤치마킹 방법론: Divergence-300 및 KL Divergence
Unsloth는 표준 top-1% 정확도(하나의 예측에 대한 argmax)가 실제 추론 성능을 측정하는 데 불충분하다고 주장합니다. 이를 해결하기 위해 두 가지 주요 지표표를 도입했습니다:
Divergence-300 @32
이 지표는 Terminal-Bench 2.1, DeepSWE, Harbor, MathArena 2025-26과 같은 소스에서 가져온 300개의 예시로 구성된 홀드아웃 데이터셋을 사용합니다. 프로세스는 32개 토큰에 대해 greedy argmax decoding을 수행하고, 양자화된 모델의 궤적(trajectories)을 BF16 (full precision) 버전과 비교합니다. 이를 통해 양자화된 모델의 출력이 여러 토큰에 걸쳐 원본과 유사하게 유지되는지 판단하며, 이는 단일 토큰 정확도보다 과적합을 더 잘 측정할 수 있는 지표가 됩니다.
KL Divergence (KLD)
Unsloth는 KL Divergence를 양자화 오류를 보고하는 골드 스탠다드로 식별했습니다. 이는 답변이 틀린 것에서 맞은 것으로, 또는 그 반대로 바뀌는
Sources
관련
- Dispatch
- 프로젝트
- Dispatch
- Dispatch
- Dispatch