Gemma 3n 릴리스 노트 / 새로운 기능

Google DeepMind은 에지 디바이스에 frontier-level 기능을 제공하도록 설계된 모바일 우선 멀티모달 모델 패밀리인 Gemma 3n을 출시했습니다. 이 출시는 원시 파라미터 수보다 현저히 작은 메모리 footprint로 모델을 실행할 수 있는 중첩 트랜스포머 아키텍처를 도입하여, 2GB RAM만큼 적은 하드웨어에서도 고성능 멀티모달 AI를 가능하게 합니다.

멀티모달 기능 및 성능

Gemma 3n은 텍스트 출력과 함께 이미지, 오디오, 비디오, 텍스트 입력을 네이티브로 지원합니다. 효과적인 파라미터를 기준으로 두 가지 주요 크기인 E2B와 E4B로 제공됩니다. 원시 파라미터 수는 각각 5B와 8B이지만, 아키텍처 최적화를 통해 메모리 footprint가 2GB(E2B)와 3GB(E4B)로 작게 운영할 수 있습니다.

주요 성능 마일스톤은 다음과 같습니다:

  • LMArena Score: E4B 버전은 100억 파라미터 미만의 모델 중 최초로 LMArena 점수 1300 이상을 달성한 모델입니다.
  • Multilinguality: 모델은 140개 언어의 텍스트와 35개 언어의 멀티모달 이해를 지원합니다.
  • General Improvements: 추론, 코딩, 수학 분야의 품질이 향상되었습니다.

MatFormer: 탄력적 추론 아키텍처

Gemma 3n은 중첩 트랜스포머를 활용하여 탄력적 추론을 가능하게 하는 MatFormer(마트료시카 트랜스포머) 아키텍처를 기반으로 구축되었습니다. 이 설계에서 더 큰 모델은 자체의 더 작지만 완전히 기능적인 버전을 포함합니다.

개발자는 다음과 같이 두 가지 방법으로 이 아키텍처를 활용할 수 있습니다:

  1. Pre-extracted Models: 사용자는 E4B 모델보다 최대 2배 빠른 추론을 위한 독립형 E2B 서브 모델을 다운로드할 수 있습니다.
  2. Mix-n-Match Customization: MatFormer Lab 도구를 사용하여 개발자는 피드-포워드 네트워크 은닉 차원을 층별로 조정(8192에서 16384 범위)하고 레이어를 선택적으로 건너뛰어 E2B와 E4B 사이의 맞춤형 크기 모델을 생성할 수 있습니다.

현재 출시에서는 아직 구현되지 않았지만, 이 아키텍처는 미래의 "탄력적 실행"을 가능하게 하여, 단일 배포된 모델이 디바이스 부하와 작업 요구에 따라 E4B와 E2B 추론 경로를 동적으로 전환할 수 있게 합니다.

메모리 및 처리 최적화

Per-Layer Embeddings (PLE)

Per-Layer Embeddings(PLE)는 모델의 파라미터 중 상당 부분—구체적으로 각 레이어와 관련된 임베딩—to CPU에서 계산하도록 허용하여 메모리 효율성을 향상시킵니다. 이를 통해 핵심 트랜스포머 가중치(E2B의 경우 약 2B, E4B의 경우 약 4B)만 제한된 가속기 메모리(VRAM)를 점유하게 됩니다.

KV Cache Sharing

오디오 및 비디오 스트림의 긴 시퀀스 처리를 가속하기 위해 Gemma 3n은 KV Cache Sharing을 구현합니다. 로컬 및 글로벌 어텐션의 중간 레이어의 키와 값을 모든 상위 레이어와 공유함으로써, Gemma 3 4B에 비해 프리필 성능이 2배 향상되어 스트리밍 애플리케이션의 첫 토큰까지의 시간을 단축합니다.

특화된 멀티모달 인코더

오디오 이해

Gemma 3n은 Universal Speech Model(USM)을 기반으로 한 오디오 인코더를 통합하여, 오디오 160ms마다 하나의 토큰을 생성합니다. 이를 통해 기기 내 자동 음성 인식(ASR)과 자동 음성 번역(AST)을 가능하게 하며, 특히 영어와 스페인어, 프랑스어, 이탈리아어, 포르투갈어 간의 번역에서 뛰어난 성능을 보입니다.

MobileNet-V5 비전 인코더

모델은 에지 디바이스에 최적화된 MobileNet-V5-300M 비전 인코더를 사용합니다. 주요 기능은 다음과 같습니다:

  • Throughput: Google Pixel에서 초당 최대 60프레임을 처리할 수 있습니다.
  • Flexibility: 256x256, 512x512, 768x768 픽셀의 입력 해상도를 지원합니다.
  • Efficiency: Gemma 3의 기준 SoViT와 비교하여 MobileNet-V5-300M은 양자화 시 13배 속도 향상(비양자화 시 6.5배)을 제공하며, 파라미터 수는 46% 적고 메모리 footprint는 4배 작습니다.

생태계 및 배포

Gemma 3n은 Hugging Face Transformers, llama.cpp, Ollama, MLX, Google AI Edge, vLLM 등을 포함한 다양한 오픈소스 도구 및 프레임워크로 지원됩니다. 배포 옵션은 Google AI Studio와 Vertex AI부터 NVIDIA API Catalog와 Cloud Run까지 다양합니다.

Sources