インテル Gaudi 2 とインテル Xeon を使用したコスト効率の高いエンタープライズ RAG アプリケーションの構築

Intel Gaudi 2 AIアクセラレータとIntel Xeon CPUを組み合わせることで、エンタープライズ向けのRetrieval-Augmented Generation(RAG)アプリケーションに対してコスト効率の高いハードウェア基盤を提供します。Open Platform for Enterprise AI(OPEA)を活用することで、開発者は総所有コスト(TCO)を最適化しつつ、重要なパフォーマンスを犠牲にしないRAGパイプラインをデプロイできます。

RAG のハードウェアアーキテクチャ

効率的なRAGアーキテクチャは、埋め込みプロセスと大規模言語モデル(LLM)推論を分離し、異なる計算要件に最適化します:

  • Embedding Model: Intel Granite Rapids CPUs 上で実行されます。このアーキテクチャは高コア数でパフォーマンスに敏感なワークロード向けに設計されており、AMX-FP16 命令セットをサポートし、混合AIワークロードで 2〜3 倍のパフォーマンス向上を提供します。
  • LLM Inference: Intel Gaudi 2 accelerators 上で実行されます。Gaudi 2 はデータセンターやクラウド環境におけるディープラーニングのトレーニングと推論のために特別に設計されています。

ソフトウェアスタックと統合

Intel は OPEA(Open Platform for Enterprise AI) フレームワークと LangChain を活用して、RAG アプリケーションのデプロイを簡素化します。技術的実装は複数の主要コンポーネントを含みます:

ベクトルデータベースと埋め込み

システムは LangChain の rag-redis テンプレートを使用し、BAAI/bge-base-en-v1.5 埋め込みモデルとベクトルデータベースとして Redis を利用します。これにより、ドメイン固有のデータ(例:財務報告書)を検索可能なベクトルストアに取り込むことができます。

TGI を使用した LLM デプロイ

LLM は Hugging Face の Text Generation Inference(TGI) サーバーを使用して Gaudi 2 上にデプロイされます。この構成は Llama、Mistral、Intel NeuralChat などの人気オープンソースモデルをサポートします。

Gaudi 2 上の TGI に対する主な最適化オプションは以下の通りです:

  • Quantization: FP8 量子化を有効にすると、BF16 と比較して 1.8 倍のスループット向上が得られます。
  • Scaling: より大きなモデル(例:70B パラメータ)は、--sharded true--num_shard パラメータを使用して複数のアクセラレータに分散させることができます。
  • Safety: コンテンツモデレーションは Meta Llama Guard モデルを使用して統合できます。

パフォーマンスとコスト分析

4 台の Intel Gaudi 2 アクセラレータ上で 16 人の同時ユーザーが Llama2-70B モデルを使用したベンチマークと、4 台の Nvidia H100 GPU を使用したベンチマークを比較すると、コスト効率に大きな差があることが明らかになりました:

  • Throughput: H100 ベースのシステムは Gaudi 2 システムに比べて 1.13 倍のスループットを実現します。
  • Performance per Dollar: Gaudi 2 システムははるかに高い価値を提供し、H100 システムは Gaudi 2 のパフォーマンス・パー・ドルの 0.44 倍しか提供しません。

これらの結果は、H100 が生のスループットでわずかな優位性を持つ可能性がある一方で、Intel Gaudi 2 がエンタープライズ規模の RAG デプロイに対してより好ましい総所有コスト(TCO)を提供することを示しています。

技術仕様

Gaudi 2 の構成

  • Hardware: HLS-Gaudi2、8 枚の Habana Gaudi2 HL-225H Mezzanine カード、2 台の Intel Xeon Platinum 8380 CPU、1TB のシステムメモリを搭載しています。
  • OS: Ubuntu 22.04.03。

H100 の構成

  • Hardware: Lambda labs のインスタンス gpu_8x_h100_sxm5、8 台の H100 SXM、2 台の Intel Xeon Platinum 8480 CPU、1.8TB のシステムメモリを備えています。
  • OS: Ubuntu 20.04.6 LTS。

Intel Xeon の構成

  • Hardware: プレプロダクションの Granite Rapids プラットフォーム、2Sx120C @ 1.9GHz、8800 MCR DIMM、1.5TB のシステムメモリを搭載しています。
  • OS: CentOS 9。

Sources