使用 Intel Gaudi 2 和 Intel Xeon 构建成本高效的企业 RAG 应用

RAG 的硬件架构

高效的 RAG 架构将嵌入过程与大语言模型(LLM)推理分离,以针对不同的计算需求进行优化:

  • Embedding Model:Intel Granite Rapids CPUs 上运行。该架构针对高核数、对性能敏感的工作负载设计,并支持 AMX-FP16 指令集,可为混合 AI 工作负载提供 2-3 倍的性能提升。
  • LLM Inference:Intel Gaudi 2 accelerators 上运行。Gaudi 2 专为数据中心和云环境中的深度学习训练与推理而打造。

软件栈与集成

Intel 使用 OPEA (Open Platform for Enterprise AI) 框架和 LangChain 来简化 RAG 应用的部署。技术实现涉及多个关键组件:

向量数据库与嵌入

系统使用 LangChain 中的 rag-redis 模板,采用 BAAI/bge-base-en-v1.5 嵌入模型并以 Redis 作为向量数据库。这使得可以将领域特定数据(例如金融报表)导入可搜索的向量存储中。

通过 TGI 部署 LLM

LLM 在 Gaudi 2 上通过 Hugging Face Text Generation Inference (TGI) 服务器部署。该配置支持包括 Llama、Mistral 和 Intel NeuralChat 在内的流行开源模型。

在 Gaudi 2 上使用 TGI 的关键优化选项包括:

  • Quantization: 启用 FP8 量化相较于 BF16 可实现 1.8 倍的吞吐量提升。
  • Scaling: 更大的模型(例如 70B 参数)可以使用 --sharded true--num_shard 参数在多个加速器之间分布。
  • Safety: 内容审核可以通过 Meta Llama Guard 模型集成。

性能与成本分析

基准测试比较了在四个 Intel Gaudi 2 加速器上、16 个并发用户运行 Llama2-70B 模型与四个 Nvidia H100 GPU 的情况,显示出成本效益的显著差异:

  • Throughput: 基于 H100 的系统的吞吐量比 Gaudi 2 系统高出 1.13 倍。
  • Performance per Dollar: Gaudi 2 系统提供显著更高的价值,H100 系统的每美元性能仅为 Gaudi 2 的 0.44 倍。

这些结果表明,尽管 H100 在原始吞吐量上可能略有优势,Intel Gaudi 2 在企业级 RAG 部署中提供了更具优势的总体拥有成本。

技术规格

Gaudi 2 配置

  • Hardware: HLS-Gaudi2,配备八块 Habana Gaudi2 HL-225H Mezzanine 卡、两颗 Intel Xeon Platinum 8380 CPU,以及 1TB 系统内存。
  • OS: Ubuntu 22.04.03。

H100 配置

  • Hardware: Lambda labs 实例 gpu_8x_h100_sxm5,配备 8xH100 SXM、两颗 Intel Xeon Platinum 8480 CPU,以及 1.8TB 系统内存。
  • OS: Ubuntu 20.04.6 LTS。

Intel Xeon 配置

  • Hardware: 预生产 Granite Rapids 平台,配备 2Sx120C @ 1.9GHz 和 8800 MCR DIMM,拥有 1.5TB 系统内存。
  • OS: CentOS 9。

Sources