Gemma 3 릴리스 노트 / 새로운 기능
Google은 Gemma 3를 출시했는데, 이는 네이티브 멀티모달리티, 확장된 다언어 지원, 그리고 훨씬 더 큰 컨텍스트 윈도우를 도입한 오픈웨이트 대형 언어 모델(LLM)의 새로운 세대입니다. 모델 패밀리는 1B, 4B, 12B, 27B 파라미터의 네 가지 크기로 구성되며, 사전 학습된(베이스) 버전과 지시 튜닝된(IT) 버전을 모두 제공합니다.
핵심 기능 및 모델 변형
Gemma 3은 다양한 배포 환경에 맞게 설계된 확장 가능한 모델 범위를 제공하며, 온디바이스 애플리케이션부터 고성능 서버까지 포함됩니다. 1B 모델은 텍스트 전용으로 유지되는 반면, 4B, 12B, 27B 변형은 완전 멀티모달이며 이미지와 텍스트를 모두 처리할 수 있습니다.
| 모델 | 사전 학습됨 | 지시 튜닝됨 | 멀티모달 | 다언어 | 컨텍스트 윈도우 |
|---|---|---|---|---|---|
| 1B | gemma-3-1b-pt |
gemma-3-1b-it |
아니오 | 영어 | 32K |
| 4B | gemma-3-4b-pt |
gemma-3-4b-it |
예 | 140+ 언어 | 128K |
| 12B | gemma-3-12b-pt |
gemma-3-12b-it |
예 | 140+ 언어 | 128K |
| 27B | gemma-3-27b-pt |
gemma-3-27b-it |
예 | 140+ 언어 | 128K |
기술적 향상
Gemma 3은 Gemma 2보다 다용도성과 효율성을 향상시키기 위해 세 가지 주요 기술 업그레이드를 도입합니다.
확장된 컨텍스트 길이
컨텍스트 윈도우는 Gemma 2의 8k에서 4B, 12B, 27B 모델의 경우 128k로 증가했으며(1B 모델의 경우 32k), 처음부터 다시 훈련하지 않고これを 달성하기 위해 Google은 다음과 같은 방법을 사용했습니다:
- Positional Embedding Adjustments: RoPE 기본 주파수가 10k에서 1M으로 업그레이드되었고, 8의 배율로 스케일링되었습니다.
- KV Cache Optimization: 모델은 슬라이딩 윈도우 인터리브드 어텐션을 사용합니다. 하이퍼파라미터는 로컬 레이어 5개와 글로벌 레이어 1개를 인터리브하도록 조정되었고, 윈도우 크기를 1024 토큰으로 줄였습니다.
네이티브 멀티모달리티
멀티모달 기능은 SigLIP 이미지 인코더로 구동되며, 이는 896x896 크기로 조정된 정사각형 이미지를 처리합니다. 추론 중에 비정사각형 종횡비와 고해상도 이미지를 처리하기 위해 Gemma 3은 세부 사항을 확대하기 위해 이미지를 적응적으로 자르는 'pan and scan' 알고리즘을 사용합니다.
어텐션 메커니즘은 입력 유형에 따라 달라집니다:
- Text: 단방향 (causal) 어텐션을 사용합니다.
- Images: 전체 양방향 어텐션을 사용하며, 마스크 없이 이미지의 모든 부분을 분석할 수 있게 합니다.
다언어 지원
다언어 데이터의 양을 두 배로 늘려 사전 훈련 데이터셋의 언어 범위를 확장했습니다. 모델은 262K 항목을 가진 Gemini 2.0 SentencePiece 토크나이저를 사용하며, 이는 중국어, 일본어, 한국어 텍스트의 인코딩을 구체적으로 개선합니다.
성능 및 평가
LMSys Chatbot Arena에서의 인간 선호도 평가에서 Gemma 3 27B IT 모델은 Elo 점수 1339를 달성하여 전체 모델 중 상위 10위에 랭크되었으며, o1-preview와 비교 가능하게 만들었습니다.
27B 모델의 벤치마크 성능은 다음과 같습니다:
- Reasoning and Math: MATH에서 69.0, GPQA Diamond에서 42.4
- Multimodal and Factual: MMMU에서 64.9, FACTS Grounding에서 74.9
- Coding and SQL: LiveCodeBench에서 29.7, Bird-SQL에서 54.4
- General Knowledge: MMLU-Pro에서 67.5
폐쇄형 Gemini 모델과 경쟁력이 있음에도 불구하고, 27B 모델은 기본 사실에서 약점을 보여 SimpleQA에서 10.0점을 받았습니다.
배포 및 추론
Hugging Face Transformers
Gemma 3은 두 가지 주요 클래스를 통해 transformers 라이브러리에 통합됩니다:
Gemma3ForConditionalGeneration: 4B, 12B, 27B 비전-언어 모델에 사용됩니다.Gemma3ForCausalLM: 1B 텍스트 전용 모델에 사용되거나, 비전 타워를 생략하여 멀티모달 모델을 텍스트 전용 LLM으로 실행하는 데 사용됩니다.
온디바이스 및 저리소스 옵션
로컬 배포를 위해 Gemma 3은 여러 프레임워크를 지원합니다:
- MLX:
mlx-vlm을 통해 Apple Silicon(Mac 및 iPhone)에서 제로일 지원을 제공합니다. - Llama.cpp: 로컬 CPU/GPU 실행을 위해 사전 양자화된 GGUF 파일을 사용할 수 있습니다.
- Hugging Face Endpoints: Inference Catalog을 통해 12B 및 27B IT 모델에 대한 원클릭 배포를 사용할 수 있습니다.