使用 Intel Gaudi 2 與 Intel Xeon 建構具成本效益的企業 RAG 應用程式

RAG 的硬體架構

高效的 RAG 架構將嵌入(embedding)流程與大型語言模型(LLM)推論分離,以針對不同的運算需求進行最佳化:

  • 嵌入模型(Embedding Model):Intel Granite Rapids CPU 上執行。此架構針對高核心數、對效能敏感的工作負載設計,並支援 AMX-FP16 指令集,可為混合 AI 工作負載提供 2-3 倍的效能提升。
  • LLM 推論(LLM Inference):Intel Gaudi 2 加速卡 上執行。Gaudi 2 專為資料中心與雲端環境中的深度學習訓練與推論而打造。

軟體堆疊與整合

Intel 使用 OPEA(Open Platform for Enterprise AI) 框架與 LangChain 來簡化 RAG 應用程式的部署。技術實作涉及多個關鍵元件:

向量資料庫與嵌入

系統使用 LangChain 中的 rag-redis 範本,採用 BAAI/bge-base-en-v1.5 嵌入模型,並以 Redis 作為向量資料庫。這使得能將領域特定資料(例如財務申報文件)匯入可搜尋的向量儲存中。

透過 TGI 部署 LLM

LLM 透過 Hugging Face Text Generation Inference(TGI) 伺服器部署於 Gaudi 2。此配置支援包括 Llama、Mistral 與 Intel NeuralChat 在內的熱門開源模型。

在 Gaudi 2 上使用 TGI 的關鍵最佳化選項包括:

  • 量化(Quantization): 啟用 FP8 量化可較 BF16 提升 1.8 倍的吞吐量。
  • 擴展(Scaling): 較大的模型(例如 70B 參數)可透過 --sharded true--num_shard 參數分散至多個加速卡上。
  • 安全性(Safety): 可使用 Meta Llama Guard 模型整合內容審查。

效能與成本分析

將 Llama2-70B 模型在四顆 Intel Gaudi 2 加速卡上、同時 16 位使用者的效能與四顆 Nvidia H100 GPU 進行比較的基準測試,顯示出成本效益的顯著差異:

  • 吞吐量(Throughput): 基於 H100 的系統的吞吐量比 Gaudi 2 系統高出 1.13 倍。
  • 每美元效能(Performance per Dollar): Gaudi 2 系統提供顯著更高的價值,H100 系統的每美元效能僅為 Gaudi 2 的 0.44 倍。

這些結果顯示,雖然 H100 在純粹吞吐量上可能略有優勢,但 Intel Gaudi 2 為企業規模的 RAG 部署提供了更具吸引力的總擁有成本(TCO)。

技術規格

Gaudi 2 配置

  • 硬體(Hardware): HLS-Gaudi2,配備八張 Habana Gaudi2 HL-225H Mezzanine 卡、兩顆 Intel Xeon Platinum 8380 CPU 與 1TB 系統記憶體。
  • 作業系統(OS): Ubuntu 22.04.03。

H100 配置

  • 硬體(Hardware): Lambda labs 實例 gpu_8x_h100_sxm5,配備 8 顆 H100 SXM、兩顆 Intel Xeon Platinum 8480 CPU 與 1.8TB 系統記憶體。
  • 作業系統(OS): Ubuntu 20.04.6 LTS。

Intel Xeon 配置

  • 硬體(Hardware): 前期生產的 Granite Rapids 平台,配備 2Sx120C @ 1.9GHz 與 8800 MCR DIMM,總計 1.5TB 系統記憶體。
  • 作業系統(OS): CentOS 9。

Sources