Gemma 4 12B release notes / what's new

Google은 소비자용 하드웨어에서 로컬 실행을 위해 설계된 중간 크기의 멀티모달 모델인 Gemma 4 12B를 출시했습니다. 이 모델은 엣지 최적화된 E4B와 더 큰 26B Mixture of Experts (MoE) 모델 사이의 간극을 메우며, 메모리 사용량을 줄이면서도 고성능 추론 및 에이전트 기능을 제공합니다.

Unified Encoder-Free Architecture

Gemma 4 12B는 지연 시간과 메모리 오버헤드를 줄이기 위해 전통적인 멀티모달 인코더를 제거했습니다. 이미지와 오디오를 LLM을 위한 표현으로 변환하기 위해 별도의 모델을 사용하는 대신, 모델은 이러한 입력을 LLM 백본에 직접 통합합니다.

  • Vision Processing: 표준 비전 인코더는 단일 행렬 곱셈, 위치 임베딩(positional embedding), 그리고 정규화(normalizations)로 구성된 경량 임베딩 모듈로 대체됩니다.
  • Audio Processing: 오디오 인코더는 완전히 제거되었습니다. 원시 오디오 신호는 텍스트 토큰과 동일한 차원의 공간으로 직접 투영됩니다.

Local Deployment and Hardware Requirements

Gemma 4 12B는 16GB의 VRAM 또는 통합 메모리를 갖춘 노트북에 최적화되어 있습니다. 이를 통해 개발자는 클라우드 인프라에 의존하지 않고 최첨단 멀티모달 에이전트를 로컬에서 실행할 수 있습니다.

저지연 추론을 지원하기 위해, 모델은 Multi-Token Prediction (MTP) drafter를 포함합니다. 이 모델은 Apache 2.0 라이선스로 출시되어 개발자 생태계 전반에 걸친 폭넓은 접근성을 보장합니다.

Integration and Tooling

개발자는 다음과 같은 업계 표준 도구를 사용하여 모델을 통합할 수 있습니다:

  • Inference Engines: llama.cpp, vLLM, SGLang, 및 MLX.
  • Local LLM Apps: LM Studio 및 Ollama.
  • Fine-tuning: Unsloth.
  • Deployment: Google Cloud (Cloud Run, GKE, 및 Gemini Enterprise Agent Platform Model Garden).

Performance and Community Feedback

Gemma 4 12B는 표준 벤치마크에서 26B MoE 모델에 근접하는 추론 성능을 제공하면서도 메모리를 절반 미만으로 사용합니다. 하지만, 초기 커뮤니티 테스트 결과, 실제 환경에서의 멀티모달 정확도에 대해서는 엇갈린 반응이 나타나고 있습니다.

Technical Insights from the Community

사용자들은 비전 및 오디오 작업에서 다양한 결과를 보고했습니다. 일부 사용자는 특정 테스트에서 비전 기능이 Qwen 3.5 0.8B와 같은 훨씬 작은 모델보다 열등하다고 느꼈으며, 다른 사용자들은 더 큰 Gemma 모델이 올바르게 처리했던 특정 객체(예: Taj Mahal)를 식별하는 데 실패하는 것을 관찰했습니다.

Memory and Quantization Considerations

Google은 모델이 16GB RAM에서 실행된다고 명시했지만, 커뮤니티 구성원들은 이것이 양자화(quantization)를 필요로 할 가능성이 높다고 지적했습니다. 원래 웨이트(weights)는 16-bit float (BF16)로 출시되어 16GB 메모리를 초과할 것입니다. 사용자들은 llama.cpp를 통해 4-bit (Q4) 및 8-bit (Q8) 양자화를 성공적으로 실행했으며, 일부는 하드웨어(예: RTX 4080 Super)에 따라 초당 25-72 토큰의 생성 속도를 보고했습니다.

"I ran the Q4 quant... The result is decent, but it had a few bizarre/trivial syntax errors I had to fix manually... it roughly compares with GPT-4.1... on the output."

Summary of Model Capabilities

Feature Gemma 4 12B
Architecture Unified, Encoder-Free
Primary Hardware Target Laptops (16GB RAM/VRAM)
License Apache 2.0
Key Modalities Text, Vision, Audio (Native)
Optimization Multi-Token Prediction (MTP)

Sources