Gemma 4 on vLLM: 고급 추론 및 멀티모달 기능

Gemma 4 on vLLM: 고급 추론 및 멀티모달 기능

vLLM은 Google의 가장 정교한 오픈 모델 라인업인 Gemma 4에 대한 즉각적인 지원을 발표했습니다. 이번 릴리스를 통해 개발자는 Google TPUs, AMD GPUs, Intel XPUs 등 다양한 하드웨어 백엔드에서 고급 추론 및 에이전시 기능을 갖춘 파라미터당 높은 지능을 제공하는 모델을 배포할 수 있게 됩니다.

모델 패밀리 및 아키텍처

Gemma 4는 Gemini 3와 동일한 연구와 기술을 사용해 구축되었으며, 상업적으로 관대한 Apache 2.0 라이선스로 공개됩니다. 이 패밀리는 다양한 하드웨어 환경에 맞게 설계된 네 가지 서로 다른 모델 크기로 구성됩니다:

  • Effective 2B (E2B): 엣지 디바이스용으로 설계되었습니다.
  • Effective 4B (E4B): 엣지 디바이스용으로 설계되었습니다.
  • 26B Mixture of Experts (MoE): 더 크고 효율적인 변형.
  • 31B Dense: 패밀리 중 가장 큰 밀집 모델.

핵심 기술 역량

Gemma 4는 최첨단 연구와 제품 혁신을 지원하기 위해 추론, 모달리티, 규모 측면에서 여러 돌파구를 제시합니다:

고급 추론 및 에이전시 워크플로

Gemma 4는 복잡한 다단계 계획을 위해 설계되었으며, 수학 및 논리 중심의 지시 수행에서 큰 향상을 제공합니다. 자율 에이전트를 지원하기 위해 모델은 기본적으로 다음을 지원합니다:

  • Function-calling
  • Structured JSON output
  • System instructions

멀티모달 처리

모든 Gemma 4 모델은 가변 해상도의 이미지와 비디오를 기본적으로 처리할 수 있으며, 특히 OCR 및 차트 이해에 뛰어납니다. 또한, 엣지 모델(E2B 및 E4B)은 음성 인식을 위한 기본 오디오 입력을 포함합니다.

컨텍스트 윈도우 및 언어 지원

모델은 확장된 컨텍스트 윈도우를 통해 방대한 데이터셋을 지원합니다: 엣지 모델은 128K, 대형 변형은 최대 256K. 또한, Gemma 4는 140개 이상의 언어에 대해 기본적으로 학습되어 전 세계 애플리케이션 개발을 용이하게 합니다.

코드 생성

이 라인업은 고품질 오프라인 코드 지원을 제공하여 표준 워크스테이션에서 로컬 우선 AI 개발 환경을 가능하게 합니다.

하드웨어 호환성 및 배포

vLLM은 하드웨어 오버헤드를 줄이기 위해 여러 하드웨어 백엔드에 걸쳐 Gemma 4에 대한 최적화된 지원을 제공합니다. 배포는 다음을 지원합니다:

  • Nvidia GPUs
  • AMD GPUs
  • Intel XPUs
  • Google TPUs

지원 범위는 노트북급 하드웨어부터 데이터센터 가속기까지이며, Trillium 및 Ironwood TPUs를 사용한 Google Kubernetes (GKE)와 Google Compute Engine (GCE)에 대한 특정 통합을 포함합니다.

Sources