Gemma 3n 릴리스 노트: 멀티모달 온-디바이스 AI

Gemma 3n은 텍스트, 이미지, 오디오, 비디오 입력을 지원하는 로컬 하드웨어 실행을 위해 설계된 네이티브 멀티모달 모델입니다. 이번 릴리스를 통해 오픈소스 커뮤니티는 소비자 수준 GPU와 모바일 디바이스에서 실행 가능한 고성능, 소형 모델을 사용할 수 있게 되었습니다.

모델 변형 및 메모리 효율성

Gemma 3n은 두 가지 주요 크기로 출시되며, 각각 베이스와 인스트럭트 변형이 제공됩니다. 모델은 "E"가 "Effective(효과적인)" 파라미터를 의미하는 비표준 명명법을 사용합니다. 실제 파라미터 수는 더 많지만, 메모리 효율성 향상으로 인해 훨씬 낮은 VRAM 요구량으로 동작할 수 있습니다.

  • gemma-3n-E2B: 실제 파라미터 수는 5B이지만 GPU RAM이 2GB만 필요합니다.
  • gemma-3n-E4B: 실제 파라미터 수는 8B이지만 GPU RAM이 3GB만 필요합니다.

기술 아키텍처

Gemma 3n은 언어 디코더와 비전 및 오디오 전용 인코더를 결합하여 네이티브 멀티모달을 구현합니다.

비전 및 오디오 인코더

  • Vision Encoder (MobileNet-V5): 300M 파라미터를 가진 MobileNet-v5-300을 사용합니다. 256x256, 512x512, 768x768 해상도를 지원합니다. Google Pixel 디바이스에서 60 FPS를 달성하며, 파라미터 수가 세 배 적은 ViT Giant보다 뛰어난 성능을 보입니다.
  • Audio Encoder: Universal Speech Model(USM)을 기반으로 하며, 160ms 청크 단위로 오디오를 처리하고 음성-텍스트 변환 및 번역(예: 영어 → 스페인어 또는 프랑스어)을 지원합니다.

아키텍처 혁신

  • MatFormer Architecture: 레이어의 부분집합을 개별 모델로 추출할 수 있는 중첩 트랜스포머 설계입니다. E2B 모델은 E4B의 서브 모델로 구성되어, 사용자가 메모리 예산과 하드웨어에 맞게 레이어를 자유롭게 조합할 수 있습니다.
  • Per-Layer Embeddings (PLE): 임베딩을 CPU로 오프로드하여 가속기 메모리 사용량을 줄이는 기술로, 5B 파라미터 E2B 모델이 2B 파라미터 모델 수준의 VRAM만 차지하도록 합니다.
  • KV Cache Sharing: 오디오 및 비디오 처리 시 프리필을 가속화하는 기능으로, Gemma 3 4B 대비 프리필 속도가 2배 빨라집니다.

성능 및 기능

Gemma 3n은 높은 효율성과 광범위한 언어 지원을 보여줍니다:

  • LMArena Score: E4B 모델은 1300점 이상을 기록한 최초의 서브-10B 모델입니다.
  • Multilingual Support: 텍스트에 대해 140개 언어, 멀티모달 상호작용에 대해 35개 언어를 지원합니다.
  • Benchmarks: E4B, E2B 및 다양한 Mix-n-Match 구성에서 MMLU 벤치마크에서 경쟁력 있는 성능을 보입니다.

생태계 통합 및 배포

Gemma 3n은 여러 주요 오픈소스 라이브러리와 런타임에 통합되어 있습니다:

  • Transformers & Timm: 아키텍처와 MobileNet-v5 비전 인코더에 대한 레퍼런스 구현입니다.
  • MLX: 텍스트, 이미지, 오디오 세 가지 모달리티에 대한 Day 0 지원을 제공합니다.
  • llama.cpp & Ollama: 텍스트 전용 입력을 지원합니다.
  • Transformers.js & ONNXRuntime: gemma-3n-E2B-it 변형에 대한 ONNX 가중치가 제공되며, Transformers.js 버전 3.6.0에 통합됩니다.
  • Google AI Edge: 온-디바이스 배포를 지원합니다.

파인튜닝 및 리소스

개발자는 Hugging Face Gemma Recipes 저장소에 포함된 스크립트와 노트북을 사용해 Gemma 3n을 특정 작업에 맞게 파인튜닝할 수 있습니다. 일반적인 T4 GPU 파인튜닝을 위한 Google Colab 노트북과 오디오 작업을 위한 특화 파인튜닝 노트북이 제공됩니다.

Sources