Gemma 4 출시: 온디바이스 지원을 갖춘 오픈 소스 멀티모달 모델
TL;DR
Google DeepMind의 새로운 멀티모달 제품군인 Gemma 4가 이제 Hugging Face에서 Apache 2.0 라이선스로 공개되었습니다. 이미지, 오디오, 비디오 이해 기능을 제공하며, 최대 256K 컨텍스트 윈도우와 transformers, llama.cpp, MLX, Rust, WebGPU를 통한 온디바이스 배포를 지원합니다.
Gemma 4의 새로운 점은 무엇인가요?
Gemma 4는 Gemma 라인업에 진정한 멀티모달리티(이미지, 오디오, 비디오)를 추가하고, 가변 종횡비 이미지 토큰 예산을 지원하며, 2.3B 파라미터 엣지 모델(E2B)부터 31B 밀집(dense) 모델에 이르기까지 5가지 모델 크기를 제공합니다. 각 모델은 base 및 instruction-tuned 체크포인트를 포함합니다. 모든 모델은 128k 또는 256k 토큰 컨텍스트 윈도우를 지원하여 온디바이스에서 긴 형식의 추론 및 에이전트 활용 사례를 가능하게 합니다.
| 모델 | 유효 파라미터 | 컨텍스트 | 체크포인트 |
|---|---|---|---|
| Gemma 4 E2B | 2.3B (임베딩 포함 5.1B) | 128k | base, instruction-tuned |
| Gemma 4 E4B | 4.5B (임베딩 포함 8B) | 128k | base, instruction-tuned |
| Gemma 4 12B Unified | 11.95B dense (encoder-free) | 256k | base, instruction-tuned |
| Gemma 4 31B | 31B dense | 256k | base, instruction-tuned |
| Gemma 4 26B A4B (MoE) | 총 26B, 활성 4B | 256k | base, instruction-tuned |
아키텍처 하이라이트
교차 슬라이딩 윈도우 및 글로벌 어텐션 (Alternating Sliding-Window and Global Attention)
작은 밀집 모델은 512-토큰 슬라이딩 윈도우를 사용하며, 큰 모델은 1024-토큰 윈도우를 사용하고 전체 컨텍스트 레이어와 교차하여 연산량을 선형적으로 유지하면서 장거리 의존성을 보존합니다.
이중 RoPE 구성 (Dual RoPE Configurations)
표준 회전 위치 임베딩(RoPE)이 슬라이딩 레이어를 구동하며, 가지치기된(pruned) RoPE 변형이 글로벌 레이어를 구동하여 추가 메모리 없이 유효 컨텍스트를 확장합니다.
레이어별 임베딩 (Per-Layer Embeddings, PLE)
PLE는 각 토큰에 대해 가벼운 레이어별 조건부 벡터를 추가합니다. 이는 토큰 식별 룩업과 컨텍스트 인식 프로젝션을 결합하여, 초기 임베딩 테이블에 과부하를 주지 않고도 후속 레이어가 토큰별 신호를 받을 수 있도록 합니다. 이는 적절한 파라미터 비용으로 전문성을 향상시키며, pad token ID를 사용하여 멀티모달 플레이스홀더에도 작동합니다.
공유 KV 캐시 (Shared KV Cache)
마지막 N개 레이어는 동일한 어텐션 유형의 이전 비공유 레이어에서 키-값(KV) 텐서를 재사용합니다. 이는 특히 긴 컨텍스트 생성 중에 품질 저하를 거의 일으키지 않으면서 연산과 메모리를 모두 줄여줍니다.
비전 및 오디오 인코더
- 비전 인코더 (12B를 제외한 모든 모델)는 학습된 2D 위치, 다차원 RoPE를 사용하며, 원래 종횡비를 보존하면서 70-1120 토큰의 토큰 예산을 지원합니다.
- 오디오 인코더 (E2B, E4B)는 Gemma-3n과 동일한 USM 스타일의 conformer입니다.
- Unified 12B는 별도의 인코더를 제거했습니다. 원본 이미지 패치와 오디오 파형이 LLM 임베딩 공간으로 직접 투영되어 지연 시간과 미세 조정(fine-tuning)을 단순화합니다.
멀티모달 기능
Gemma 4는 OCR, speech-to-text, 객체 탐지, 포인팅 및 멀티모달 함수 호출을 기본적으로 처리합니다. 모델은 엄격한 입력 순서를 따릅니다: 이미지는 텍스트보다 먼저, 오디오는 텍스트 다음에 옵니다. 이 관례는 내장된 채팅 템플릿에 필수적입니다.
예시: GUI 요소 탐지
프롬프트: “이미지에서 "view recipe" 요소의 경계 상자(bounding box)는 무엇인가요?” 모델은 1000 × 1000 캔버스에 대한 상대적 좌표가 포함된 JSON을 반환하며, 별도의 후처리가 필요하지 않습니다.
예시: 비디오 이해
Gemma 4는 선택적 오디오 추출 기능과 함께 비디오 URL을 입력받을 수 있습니다. 작은 모델(E2B/E4B)은 오디오를 처리할 수 있으며, 큰 모델은 비디오 전용 스트림을 처리합니다. 샘플 출력은 정확한 장면 설명과 노래 주제 추론을 보여줍니다.
예시: 오디오 질의응답 및 전사
동일한 채팅 템플릿을 사용하여 Gemma 4는 음성에 대한 상세한 질문에 답하거나 구두 전사(verbatim transcription)를 생성할 수 있습니다. E4B 모델의 전사는 구두점과 대소문자가 포함된 참조 텍스트와 일치합니다.
예시: 멀티모달 함수 호출
“이 이미지에 있는 도시는 어디인가요? 그곳의 날씨를 확인해 주세요”라고 요청하면, 모델은 도시(Bangkok)를 식별하고 올바르게 형식화된 도구 호출 get_weather(city="Bangkok")를 생성합니다.
어디서나 배포 가능
Gemma 4는 광범위한 추론 엔진에 대한 day-0 지원과 함께 출시되어 엣지 및 브라우저 배포를 가능하게 합니다.
Transformers (Python)
pip install -U transformers
from transformers import pipeline
pipe = pipeline("any-to-any", model="google/gemma-4-e2b-it")
파이프라인은 혼합 모달리티 메시지와 비디오를 위한 선택적 load_audio_from_video=True를 수락합니다.
Llama.cpp (C++)
curl -LsSf https://llama.app/install.sh | sh
llama serve -hf ggml-org/gemma-4-E2B-it-GGUF
모든 크기에 대해 GGUF 체크포인트가 제공되며, 서빙 시 양자화(quantization)를 선택할 수 있습니다.
Transformers.js (Browser)
Gemma 4는 transformers.js를 통해 WebGPU에서 실행됩니다. 데모 공간에서는 브라우저에서 직접 이미지-텍스트 및 오디오-텍스트 추론을 보여줍니다.
MLX (Apple Silicon)
mlx-vlm 라이브러리는 4배의 메모리 절감을 제공하는 TurboQuant를 제공하며 M-시리즈 칩에서 긴 컨텍스트 추론을 지원합니다.
Mistral.rs (Rust)
Mistral.rs는 내장된 도구 호출 및 멀티모달 지원을 갖춘 OpenAI 호환 서버를 제공합니다. 단일 스크립트로 설치하고 모든 Gemma 4 체크포인트를 서빙할 수 있습니다.
Multi-Token Prediction Drafters
Google는 모든 Gemma 4 크기에 대해 투기적 드래프터(speculative drafters)를 출시했습니다. 드래프터는 단일 순전파(forward pass)에서 여러 개의 미래 토큰을 제안하며, 타겟 모델이 이를 검증하여 품질 저하 없이 최대 ~3배의 속도 향상을 제공합니다. 드래프터는 메인 모델과 KV 캐시를 공유하며, 엣지 변형에는 임베더 클러스터링을 사용합니다.
DiffusionGemma: 확산을 통한 텍스트 생성
DiffusionGemma (26B A4B)는 토큰별 자기회귀(autoregression) 방식 대신 토큰 블록을 병렬로 노이즈 제거(denoising)하여 텍스트를 생성합니다. 이는 순전파당 15-20개의 토큰을 생성하며, 낮은 배치 크기에서 H100 FP8 기준 1100 tokens/s를 초과합니다. 정확도는 약간 감소하지만(예: MMLU Pro 77.6% vs 자기회귀 26B A4B의 82.6%), 지연 시간에 민감한 애플리케이션에서 처리량 이득이 매우 큽니다.
쉬운 미세 조정 (Fine-Tuning)
TRL 통합
Gemma 4는 멀티모달 도구 응답 훈련을 포함하여 지도 미세 조정을 위한 trl 라이브러리와 함께 작동합니다. 예시 스크립트는 모델이 CARLA 시뮬레이터에서 운전하도록 훈련하며, 비전-to-액션 학습을 보여줍니다.
Vertex AI 지원
전체 Vertex AI 예제는 CUDA를 사용하여 커스텀 컨테이너를 실행하고, Transformers 및 TRL을 설치하고, H100 인스턴스에서 Gemma 4를 미세 조정하는 방법을 보여줍니다.
Unsloth Studio
Unsloth Studio는 로컬 또는 Colab 기반 미세 조정을 위한 UI를 제공합니다. 사용자는 원하는 Gemma 4 체크포인트를 선택하고 몇 번의 클릭만으로 훈련을 시작할 수 있습니다.
벤치마크 결과
Gemma 4는 추론, 코딩, 비전, 오디오 및 긴 컨텍스트 작업 전반에 걸쳐 새로운 파레토 프런티어(Pareto frontier)를 구축합니다. 하이라이트 (instruction-tuned 모델):
| 벤치마크 | 31B | 26B A4B | 12B Unified | 4B E4B | 2.3B E2B |
|---|---|---|---|---|---|
| MMLU Pro | 85.2% | 82.6% | 77.2% | 69.4% | 60.0% |
| AIME 2026 (no tools) | 89.2% | 88.3% | 77.5% | 42.5% | 37.5% |
| GPQA Diamond | 84.3% | 82.3% | 78.8% | 58.6% | 43.4% |
| LiveCodeBench v6 | 80.0% | 77.1% | 72.0% | 52.0% | 44.0% |
| MMMU Pro (vision) | 76.9% | 73.8% | 69.1% | 52.6% | 44.2% |
| MRCR v2 128k (long context) | 66.4% | 44.1% | 43.4% | 25.4% | 19.1% |
31B 밀집 모델은 추정 LMArena 텍스트 전용 점수 1452를 달성한 반면, 26B MoE는 단 4B의 활성 파라미터로 1441에 도달하여 극강의 효율성을 입증했습니다.
시사점
- 오픈 소스 프런티어 – 완전한 Apache 2.0 라이선스로, Gemma 4는 라이선스 장벽 없이 휴대폰, 노트북, 서버에서 실행할 수 있는 고품질 멀티모달 모델을 커뮤니티에 제공합니다.
- 온디바이스 에이전트 – 긴 컨텍스트, 공유 KV 캐시 및 효율적인 양자화의 결합은 Gemma 4를 로컬 어시스턴트, 자율 로봇 공학 및 개인정보 보호 애플리케이션에 이상적으로 만듭니다.
- 도구 호출의 동등성 – 멀티모달 함수 호출이 텍스트 전용 호출과 동일한 방식으로 작동하여, 더 풍부한 에이전트 워크플로우(예: 비전 가이드 날씨 쿼리)를 가능하게 합니다.
- 속도 대 품질의 트레이드오프 – DiffusionGemma는 생성 중심 워크로드에 대한 새로운 속도 우선 경로를 제공하며, MTP 드래프터는 답변 품질을 희생하지 않고 표준 Gemma 4 추론을 가속화합니다.
오늘 바로 Gemma 4를 사용해 보세요
- Transformers 데모 – E4B, 12B Unified, 26B A4B 및 31B를 위한 대화형 공간.
- WebGPU 데모 –
transformers.js를 통해 브라우저에서 Gemma 4를 실행하세요. - 모델 허브 – 모든 체크포인트, GGUF 파일 및 ONNX 내보내기는 https://huggingface.co/collections/google/gemma-4 에서 확인할 수 있습니다.
감사의 말
이번 출시는 Google DeepMind의 모델 기여와 Hugging Face 커뮤니티(Cyril, Raushan, Eustache, Arthur, Lysandre (transformers), Joshua (transformers.js), Eric (mistral.rs), Son (llama.cpp), Prince (MLX), Quentin, Albert, Kashif (TRL), Adarsh (SGLang), Toshihiro (demo engineering))의 광범위한 통합 작업 덕분에 가능했습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch