Gemma 4 on vLLM: 高度な推論とマルチモーダル機能
vLLMは、Googleの最も高度なオープンモデルラインアップであるGemma 4の即時サポートを発表しました。このリリースにより、開発者はGoogle TPUs、AMD GPUs、Intel XPUsを含む幅広いハードウェアバックエンド上で、先進的な推論とエージェント機能を備えた高知能パラメータあたりのモデルをデプロイできるようになります。
モデルファミリーとアーキテクチャ
Gemma 4はGemini 3と同じ研究と技術を用いて構築され、商業的に許容的なApache 2.0ライセンスの下でリリースされています。このファミリーは、異なるハードウェア環境に合わせて調整された4つの異なるモデルサイズで構成されています。
- Effective 2B (E2B): エッジデバイス向けに設計されています。
- Effective 4B (E4B): エッジデバイス向けに設計されています。
- 26B Mixture of Experts (MoE): より大きく、効率的なバリアントです。
- 31B Dense: ファミリー内で最大のデンスモデルです。
コア技術的能力
Gemma 4は、最先端の研究と製品イノベーションを支えるために、推論、モダリティ、スケールにおけるいくつかのブレークスルーを導入します。
高度な推論とエージェントワークフロー
Gemma 4は複雑なマルチステップ計画向けに設計され、数学や論理重視の指示実行において大幅な改善を提供します。自律エージェントをサポートするために、モデルはネイティブに以下をサポートします:
- Function-calling: 関数呼び出し
- Structured JSON output: 構造化JSON出力
- System instructions: システム指示
マルチモーダル処理
すべてのGemma 4モデルは可変解像度の画像と動画をネイティブに処理でき、特にOCRやチャートの理解に優れています。さらに、エッジモデル(E2BおよびE4B)は音声認識用のネイティブオーディオ入力を備えています。
コンテキストウィンドウと語彙サポート
モデルは拡張されたコンテキストウィンドウにより大規模データセットをサポートします:エッジモデルは128K、より大きなバリアントは最大256Kです。さらに、Gemma 4は140以上の言語でネイティブにトレーニングされており、グローバルアプリケーションの開発を促進します。
コード生成
このラインナップは高品質なオフラインコードサポートを提供し、標準的なワークステーション上でローカルファーストのAI開発環境を実現します。
ハードウェア互換性とデプロイメント
vLLMはハードウェアオーバーヘッドを削減するために、複数のハードウェアバックエンドにわたるGemma 4の最適化サポートを提供します。デプロイは以下でサポートされています:
- Nvidia GPUs: Nvidia GPU
- AMD GPUs: AMD GPU
- Intel XPUs: Intel XPU
- Google TPUs: Google TPU
サポートはラップトップクラスのハードウェアからデータセンターアクセラレータまで幅広く、TrilliumおよびIronwood TPUを使用したGoogle Kubernetes(GKE)やGoogle Compute Engine(GCE)との特定の統合も含まれます。