Gemma 4 12B 릴리스 노트 / 새로운 기능

Gemma 4 12B 릴리스 노트 / 새로운 기능

Google DeepMind은 로컬 하드웨어에 에이전트형 지능을 제공하도록 설계된 중간 크기의 멀티모달 모델인 Gemma 4 12B를 도입했습니다. 통합된 인코더 프리 아키텍처를 활용하여, 이 모델은 더 큰 26B Mixture of Experts (MoE) 모델에 근접한 성능을 제공하면서도 16GB VRAM 또는 통합 메모리를 갖춘 소비자용 노트북에서 실행될 수 있을 만큼 작은 메모리 사용량을 유지합니다.

통합 인코더 프리 아키텍처

Gemma 4 12B는 지연 시간과 메모리 사용량을 줄이기 위해 기존 멀티모달 인코더를 제거합니다. 언어 모델에 전달하기 전에 이미지와 오디오를 번역하기 위해 별도의 인코더를 사용하는 대신, 시각 및 오디오 입력이 LLM 백본으로 직접 흐릅니다.

네이티브 시각 처리

이 모델은 표준 시각 인코더를 경량 임베딩 모듈로 대체합니다. 이 모듈은 단일 행렬 곱셈, 위치 임베딩, 그리고 정규화로 구성되어 LLM 백본이 시각 처리를 직접 처리할 수 있게 합니다.

네이티브 오디오 처리

오디오 인코더를 완전히 제거하여 오디오 처리를 더욱 간소화합니다. 원시 오디오 신호는 텍스트 토큰과 동일한 차원 공간으로 직접 투영되어, 모델이 오프라인에서 음성 입력을 전사, 포맷팅, 번역할 수 있게 합니다.

성능 및 에이전트형 기능

Gemma 4 12B는 엣지 친화적인 E4B와 26B MoE 모델 사이의 다리로 위치 지정됩니다. 이 모델은 26B 모델에 근접한 벤치마크 성능을 제공하여 로컬에서 다단계 추론 및 복잡한 에이전트형 워크플로를 처리할 수 있는 능력을 잠금 해제합니다.

이러한 기능을 지원하기 위해 Google은 에이전트가 Gemma 모델로 구축할 수 있도록 특별히 설계된 기술 라이브러리인 공식 Skills Repository를 출시하고 있습니다.

배포 및 접근성

Apache 2.0 라이선스 하에 출시된 Gemma 4 12B는 다음과 같은 여러 채널을 통해 개발자 생태계에서 접근할 수 있습니다:

  • Local Inference: LM Studio, Ollama, Google AI Edge Gallery App, Google AI Edge Eloquent app, 그리고 LiteRT-LM CLI를 통해 지원됩니다.
  • Weights and Frameworks: 사전 학습 및 지시 튜닝된 체크포인트는 Hugging Face와 Kaggle에서 사용할 수 있습니다. 구현은 Hugging Face Transformers, llama.cpp, MLX, SGLang, 그리고 vLLM을 통해 지원됩니다.
  • Fine-tuning: Unsloth를 통해 효율적인 파인튜닝을 사용할 수 있습니다.
  • Cloud Deployment: Google Cloud를 통해 프로덕션 엔드포인트를 배포할 수 있으며, 여기에는 Gemini Enterprise Agent Platform Model Garden, Cloud Run, 그리고 GKE가 포함됩니다.

지연 시간 최적화

추론 지연 시간을 줄이기 위해 Gemma 4 12B는 Multi-Token Prediction (MTP) 드래프터를 장착하여 이를 'drafter-ready' 상태로 만들어 더 빠른 응답 생성을 가능하게 합니다.

Sources