Google Cloud C4 と Intel Xeon 6 の GPT OSS 向けパフォーマンス

Google Cloud C4 仮想マシン(VM)は Intel Xeon 6 プロセッサ(Granite Rapids)を搭載し、前世代の C3 インスタンスと比較して GPT OSS 大規模言語モデル(LLM)推論の総所有コスト(TCO)を 1.7 倍向上させます。この効率は、次世代ハードウェアと Hugging Face の transformers ライブラリにおける特化したソフトウェア最適化の組み合わせによって実現されています。

パフォーマンス向上と TCO 改善

Google Cloud C4 VM は GPT OSS モデルを実行する際、C3 VM に比べてスループットとコスト効率が優れています。バッチサイズ 64 の場合、C4 インスタンスは C3 インスタンスと比較して vCPU あたり 1.7 倍のスループットを提供します。時間単価は vCPU 数に比例して増加するため、このパフォーマンス向上は直接 1.7 倍の TCO 優位性に結びつき、同等のトークン量を生成するために C3 インスタンスは 1.7 倍の費用が必要になることを意味します。

Key metrics include:

  • Throughput(スループット): vCPU あたりドルで 1.4 倍から 1.7 倍の TPOT(トークン出力時間)スループット。
  • Cost(コスト): C3 VM と比較して時間単価が低い。

MoE 推論のための技術的最適化

GPT OSS はオープンソースの Mixture of Experts(MoE)モデルです。MoE アーキテクチャはゲーティングネットワークを使用して入力を専門的な「エキスパート」サブネットワークに振り分け、計算コストを線形に増加させることなくモデルの容量を拡張できます。トークンごとにアクティブになるエキスパートはごく一部であるため、CPU 推論がこれらの大規模モデルに対して実用的な選択肢となります。

効率をさらに高めるため、Intel と Hugging Face は transformers ライブラリにエキスパート実行最適化(PR #40304 によるマージ)を実装しました。この最適化は、各エキスパートがすべてのトークンを処理するのではなく、特定のトークンにのみルーティングされるようにすることで冗長な計算を排除します。この変更により無駄な FLOP が削減され、ハードウェアの総合的な利用効率が向上します。

ベンチマーク手法とハードウェア

ベンチマークは、Intel Xeon 6(GNR)と第4世代 Intel Xeon(SPR)プロセッサ間のアーキテクチャ差異を明確にするため、制御された再現性のある生成ワークロードを使用して実施しました。

ハードウェア構成

インスタンス アーキテクチャ vCPU 数
C3 4th Gen Intel Xeon processor (SPR) 172
C4 Intel Xeon 6 processor (GNR) 144

ワークロードパラメータ

  • Model(モデル): unsloth/gpt-oss-120b-BF16
  • Precision(精度): bfloat16
  • Input/Output Length(入力/出力長): 各 1024 トークン
  • Batch Sizes(バッチサイズ): 1, 2, 4, 8, 16, 32, 64
  • Optimizations(最適化): 静的 KV キャッシュと決定論的なための SDPA(Scaled Dot Product Attention)注意バックエンド

結論

Intel と Hugging Face の協業により、大規模 MoE モデルが次世代の汎用 CPU 上で効率的に提供できることが示されました。Google Cloud C4 VM の Intel Xeon 6 アーキテクチャと特定のフレームワーク最適化を組み合わせることで、開発者は大規模 LLM 推論において、より高いスループット、低レイテンシ、そして運用コストの削減を実現できます。

Sources