インテル Gaudi 2 とインテル Xeon を使用したコスト効率の高いエンタープライズ RAG アプリケーションの構築
Intel Gaudi 2 AIアクセラレータとIntel Xeon CPUを組み合わせることで、エンタープライズ向けのRetrieval-Augmented Generation(RAG)アプリケーションに対してコスト効率の高いハードウェア基盤を提供します。Open Platform for Enterprise AI(OPEA)を活用することで、開発者は総所有コスト(TCO)を最適化しつつ、重要なパフォーマンスを犠牲にしないRAGパイプラインをデプロイできます。
RAG のハードウェアアーキテクチャ
効率的なRAGアーキテクチャは、埋め込みプロセスと大規模言語モデル(LLM)推論を分離し、異なる計算要件に最適化します:
- Embedding Model: Intel Granite Rapids CPUs 上で実行されます。このアーキテクチャは高コア数でパフォーマンスに敏感なワークロード向けに設計されており、AMX-FP16 命令セットをサポートし、混合AIワークロードで 2〜3 倍のパフォーマンス向上を提供します。
- LLM Inference: Intel Gaudi 2 accelerators 上で実行されます。Gaudi 2 はデータセンターやクラウド環境におけるディープラーニングのトレーニングと推論のために特別に設計されています。
ソフトウェアスタックと統合
Intel は OPEA(Open Platform for Enterprise AI) フレームワークと LangChain を活用して、RAG アプリケーションのデプロイを簡素化します。技術的実装は複数の主要コンポーネントを含みます:
ベクトルデータベースと埋め込み
システムは LangChain の rag-redis テンプレートを使用し、BAAI/bge-base-en-v1.5 埋め込みモデルとベクトルデータベースとして Redis を利用します。これにより、ドメイン固有のデータ(例:財務報告書)を検索可能なベクトルストアに取り込むことができます。
TGI を使用した LLM デプロイ
LLM は Hugging Face の Text Generation Inference(TGI) サーバーを使用して Gaudi 2 上にデプロイされます。この構成は Llama、Mistral、Intel NeuralChat などの人気オープンソースモデルをサポートします。
Gaudi 2 上の TGI に対する主な最適化オプションは以下の通りです:
- Quantization: FP8 量子化を有効にすると、BF16 と比較して 1.8 倍のスループット向上が得られます。
- Scaling: より大きなモデル(例:70B パラメータ)は、
--sharded trueと--num_shardパラメータを使用して複数のアクセラレータに分散させることができます。 - Safety: コンテンツモデレーションは Meta Llama Guard モデルを使用して統合できます。
パフォーマンスとコスト分析
4 台の Intel Gaudi 2 アクセラレータ上で 16 人の同時ユーザーが Llama2-70B モデルを使用したベンチマークと、4 台の Nvidia H100 GPU を使用したベンチマークを比較すると、コスト効率に大きな差があることが明らかになりました:
- Throughput: H100 ベースのシステムは Gaudi 2 システムに比べて 1.13 倍のスループットを実現します。
- Performance per Dollar: Gaudi 2 システムははるかに高い価値を提供し、H100 システムは Gaudi 2 のパフォーマンス・パー・ドルの 0.44 倍しか提供しません。
これらの結果は、H100 が生のスループットでわずかな優位性を持つ可能性がある一方で、Intel Gaudi 2 がエンタープライズ規模の RAG デプロイに対してより好ましい総所有コスト(TCO)を提供することを示しています。
技術仕様
Gaudi 2 の構成
- Hardware: HLS-Gaudi2、8 枚の Habana Gaudi2 HL-225H Mezzanine カード、2 台の Intel Xeon Platinum 8380 CPU、1TB のシステムメモリを搭載しています。
- OS: Ubuntu 22.04.03。
H100 の構成
- Hardware: Lambda labs のインスタンス
gpu_8x_h100_sxm5、8 台の H100 SXM、2 台の Intel Xeon Platinum 8480 CPU、1.8TB のシステムメモリを備えています。 - OS: Ubuntu 20.04.6 LTS。
Intel Xeon の構成
- Hardware: プレプロダクションの Granite Rapids プラットフォーム、2Sx120C @ 1.9GHz、8800 MCR DIMM、1.5TB のシステムメモリを搭載しています。
- OS: CentOS 9。