使用 Intel Gaudi 2 和 Intel Xeon 构建成本高效的企业 RAG 应用
RAG 的硬件架构
高效的 RAG 架构将嵌入过程与大语言模型(LLM)推理分离,以针对不同的计算需求进行优化:
- Embedding Model: 在 Intel Granite Rapids CPUs 上运行。该架构针对高核数、对性能敏感的工作负载设计,并支持 AMX-FP16 指令集,可为混合 AI 工作负载提供 2-3 倍的性能提升。
- LLM Inference: 在 Intel Gaudi 2 accelerators 上运行。Gaudi 2 专为数据中心和云环境中的深度学习训练与推理而打造。
软件栈与集成
Intel 使用 OPEA (Open Platform for Enterprise AI) 框架和 LangChain 来简化 RAG 应用的部署。技术实现涉及多个关键组件:
向量数据库与嵌入
系统使用 LangChain 中的 rag-redis 模板,采用 BAAI/bge-base-en-v1.5 嵌入模型并以 Redis 作为向量数据库。这使得可以将领域特定数据(例如金融报表)导入可搜索的向量存储中。
通过 TGI 部署 LLM
LLM 在 Gaudi 2 上通过 Hugging Face Text Generation Inference (TGI) 服务器部署。该配置支持包括 Llama、Mistral 和 Intel NeuralChat 在内的流行开源模型。
在 Gaudi 2 上使用 TGI 的关键优化选项包括:
- Quantization: 启用 FP8 量化相较于 BF16 可实现 1.8 倍的吞吐量提升。
- Scaling: 更大的模型(例如 70B 参数)可以使用
--sharded true和--num_shard参数在多个加速器之间分布。 - Safety: 内容审核可以通过 Meta Llama Guard 模型集成。
性能与成本分析
基准测试比较了在四个 Intel Gaudi 2 加速器上、16 个并发用户运行 Llama2-70B 模型与四个 Nvidia H100 GPU 的情况,显示出成本效益的显著差异:
- Throughput: 基于 H100 的系统的吞吐量比 Gaudi 2 系统高出 1.13 倍。
- Performance per Dollar: Gaudi 2 系统提供显著更高的价值,H100 系统的每美元性能仅为 Gaudi 2 的 0.44 倍。
这些结果表明,尽管 H100 在原始吞吐量上可能略有优势,Intel Gaudi 2 在企业级 RAG 部署中提供了更具优势的总体拥有成本。
技术规格
Gaudi 2 配置
- Hardware: HLS-Gaudi2,配备八块 Habana Gaudi2 HL-225H Mezzanine 卡、两颗 Intel Xeon Platinum 8380 CPU,以及 1TB 系统内存。
- OS: Ubuntu 22.04.03。
H100 配置
- Hardware: Lambda labs 实例
gpu_8x_h100_sxm5,配备 8xH100 SXM、两颗 Intel Xeon Platinum 8480 CPU,以及 1.8TB 系统内存。 - OS: Ubuntu 20.04.6 LTS。
Intel Xeon 配置
- Hardware: 预生产 Granite Rapids 平台,配备 2Sx120C @ 1.9GHz 和 8800 MCR DIMM,拥有 1.5TB 系统内存。
- OS: CentOS 9。