Gemma 4 QAT 출시: 에지 디바이스를 위한 모델 압축 최적화
Google은 양자화 인식 학습(Quantization-Aware Training, QAT)으로 최적화된 Gemma 4의 새로운 체크포인트를 출시했습니다. 이번 업데이트는 일반적인 압축 방식에서 발생하는 상당한 품질 저하 없이 모바일 기기, 노트북, 소비자용 GPU에서의 로컬 배포를 위해 메모리 요구 사항을 줄이고 추론 속도를 높이는 데 중점을 둡니다.
양자화 인식 학습(QAT) vs. 사후 학습 양자화(PTQ)
QAT는 학습 과정 중에 양자화를 시뮬레이션함으로써 양자화 프로세스를 학습 단계에 직접 통합합니다. 이 방식은 학습이 완료된 후 모델을 압축하는 표준 사후 학습 양자화(Post-Training Quantization, PTQ)와 비교했을 때 품질 저하를 최소화합니다. Google은 QAT 결과가 표준 PTQ 베이스라인보다 더 높은 전반적인 품질을 제공한다고 보고했습니다.
이번 출시에서는 두 가지 주요 형식으로 QAT 체크포인트를 제공합니다:
- Q4_0: 모든 Gemma 4 모델에서 성능을 극대화하도록 설계된 널리 사용되는 양자화 형식입니다.
- Mobile-Specialized Format: 에지 하드웨어의 메모리 점유율을 더욱 줄이기 위해 특별히 설계된 새로운 스키마입니다.
모바일 특화 최적화
모바일 프로세서에서 원활한 성능을 보장하기 위해, Google은 에지 하드웨어의 특정 제약 사항을 해결하는 맞춤형 양자화 스키마를 구현했습니다:
- Static Activations: 학습 중에 스케일링 설정을 미리 계산함으로써, 모델은 모바일 칩의 실시간 처리 부하를 줄여 더 빠른 응답 시간을 제공합니다.
- Channel-wise Quantization: 데이터가 모바일 가속기의 설계에 맞게 구조화되어, 느린 소프트웨어 우회 방식 없이 네이티브하게 계산을 실행할 수 있습니다.
- Targeted 2-bit Quantization: 핵심 추론 레이어는 높은 정밀도를 유지하는 반면, 토큰 생성을 담당하는 모델의 특정 부분은 저장 공간을 절약하기 위해 2-bit로 집중 압축됩니다.
- Embedding and KV Cache Optimization: 압축은 어휘 목록과 단기 메모리(KV cache)에 집중되어, 긴 대화 중 활성 메모리 점유율을 획기적으로적으로 줄입니다.
텍스트 전용 배포를 위한 Gemma 4 E2B 모델(Per-Layer Embeddings 제외)의 경우, 메모리 요구 사항이 1GB 미만으로 감소합니다.
배포 및 생태계 지원
QAT 체크포인트는 Hugging Face에서 llama.cpp용 GGUF 형식과 vLLM용 압축된 텐서로 제공됩니다. 이번 출시 또한 다음과 같은 여러 통합 경로를 지원합니다:
- Local Desktop Execution:
llama.cpp, Ollama, LM Studio를 통해 지원됩니다. - On-Device Deployment: Google의
LiteRT-LM런타임 또는Transformers.js를 통한 웹 기반 실행을 통해 에지 배포에 최적화되어 있습니다. - High-Performance Serving:
SGLang및vLLM에 의해 지원되며, Apple Silicon을 위한MLX를 통한 특정 최적화가 포함됩니다. - Fine-tuning: 가중치는 Hugging Face Transformers 및 Unsloth를 사용하여 미세 조정할 수 있습니다.
커뮤니티 인사이트 및 기술적 관찰
개발자 피드백은 이러한 압축 모델의 실용적인 유용성과 한계점을 모두 강조합니다:
성능 및 정확도
일부 사용자들은 서드파티 최적화가 결과를 더욱 개선할 수 있다고 언급했습니다. 한 사용자는 Unsloth의 QAT quants가 BF16 비양자화 모델에 비해 원래 Google QAT 체크포인트보다 더 높은 정확도를 유지하는 것으로 보인다고 보고했습니다:
"BF16 비양자화 모델과 비교했을 때 정확도가 100%에 매우 근접하게 나타나며, Unsloth의 quants는 기사에 게시된 원래 Google의 QAT와 더 우는 것 같습니다."
VRAM 및 하드웨어 호환성
Gemma 4 12B 모델의 Q4_0 변체는 약 6.7GB의 VRAM을 필요로 하며, 이는 16GB RAM을 가진 머신에서 실행 가능합니다. 그러나 커뮤니티 구성원들은 macOS용 Google Edge Gallery에서 12B 모델이 Q4_0 변체의 낮은 요구 사항에도 불구하고 RAM 제약으로 인해 지원되지 않는 것으로 표시된 불일치 사항을 언급했습니다.
멀티모달 기능
초기 테스트 결과, 압축된 E2B 모델은 멀티모달 작업을 수행할 수 있는 능력을 유지하고 있습니다. 한 사용자는 litert-lm을 사용하여 Mac에서 gemma-4-E2B-it-litert-lm 모델(약 3.2GB)을 성공적으로 실행하는 데 성공했으며, 이는 오디오 및 이미지 입력을 처리하고 심지어 유효한 SVG 코드를 생성하는 능력을 입증했습니다.