Gemma 4 on vLLM: 高度な推論とマルチモーダル機能

vLLMは、Googleの最も高度なオープンモデルラインアップであるGemma 4の即時サポートを発表しました。このリリースにより、開発者はGoogle TPUs、AMD GPUs、Intel XPUsを含む幅広いハードウェアバックエンド上で、先進的な推論とエージェント機能を備えた高知能パラメータあたりのモデルをデプロイできるようになります。

モデルファミリーとアーキテクチャ

Gemma 4はGemini 3と同じ研究と技術を用いて構築され、商業的に許容的なApache 2.0ライセンスの下でリリースされています。このファミリーは、異なるハードウェア環境に合わせて調整された4つの異なるモデルサイズで構成されています。

  • Effective 2B (E2B): エッジデバイス向けに設計されています。
  • Effective 4B (E4B): エッジデバイス向けに設計されています。
  • 26B Mixture of Experts (MoE): より大きく、効率的なバリアントです。
  • 31B Dense: ファミリー内で最大のデンスモデルです。

コア技術的能力

Gemma 4は、最先端の研究と製品イノベーションを支えるために、推論、モダリティ、スケールにおけるいくつかのブレークスルーを導入します。

高度な推論とエージェントワークフロー

Gemma 4は複雑なマルチステップ計画向けに設計され、数学や論理重視の指示実行において大幅な改善を提供します。自律エージェントをサポートするために、モデルはネイティブに以下をサポートします:

  • Function-calling: 関数呼び出し
  • Structured JSON output: 構造化JSON出力
  • System instructions: システム指示

マルチモーダル処理

すべてのGemma 4モデルは可変解像度の画像と動画をネイティブに処理でき、特にOCRやチャートの理解に優れています。さらに、エッジモデル(E2BおよびE4B)は音声認識用のネイティブオーディオ入力を備えています。

コンテキストウィンドウと語彙サポート

モデルは拡張されたコンテキストウィンドウにより大規模データセットをサポートします:エッジモデルは128K、より大きなバリアントは最大256Kです。さらに、Gemma 4は140以上の言語でネイティブにトレーニングされており、グローバルアプリケーションの開発を促進します。

コード生成

このラインナップは高品質なオフラインコードサポートを提供し、標準的なワークステーション上でローカルファーストのAI開発環境を実現します。

ハードウェア互換性とデプロイメント

vLLMはハードウェアオーバーヘッドを削減するために、複数のハードウェアバックエンドにわたるGemma 4の最適化サポートを提供します。デプロイは以下でサポートされています:

  • Nvidia GPUs: Nvidia GPU
  • AMD GPUs: AMD GPU
  • Intel XPUs: Intel XPU
  • Google TPUs: Google TPU

サポートはラップトップクラスのハードウェアからデータセンターアクセラレータまで幅広く、TrilliumおよびIronwood TPUを使用したGoogle Kubernetes(GKE)やGoogle Compute Engine(GCE)との特定の統合も含まれます。

Sources