lucienhuangfu/eLLM
eLLM: Run Long-Horizon Inference Faster on CPUs Than on GPUs
解决的问题
eLLM 旨在克服 CPU 在运行大语言模型(LLM)时的内存带宽瓶颈,特别针对长时序任务。它使 CPU 服务器在涉及百万级令牌上下文窗口和多轮交互的场景中,能够比 GPU 更快地完成推理,从而减少对昂贵且高功耗 GPU 硬件的需求。
工作原理
该框架采用「以存储换计算」的策略,利用 DDR 内存的巨大容量,最大限度减少重复计算。关键技术实现包括:
- 弹性静态计算图:采用维度优先布局,使同一执行图可支持不同输入长度,无需重建。
- 静态形状 KV 缓存:用预分配的固定形状张量替代分页块管理,减少元数据开销并避免缓存未命中。
- 大维度张量:预留大序列维度以支持完整预填充(Prefill),避免超长提示中重复加载参数。
- 会话缓存:在多轮交互中保持 KV 状态,系统只需增量式地对新输入进行预填充,而无需重新计算整个历史。
适用人群
主要面向从事长时序 AI 代理开发的开发者和研究人员,例如计算机操作代理、大型代码库的代码协作者、企业知识库的 RAG 系统,以及需在数小时或数天内维持状态的深度研究代理。
核心亮点
- 超越 GPU 的性能:宣称在长上下文推理和长时序任务中优于 GPU。
- vLLM API 兼容:可直接接入现有 LLM 生态系统。
- 超长上下文支持:利用 TB 级内存,支持百万级、近乎无限制的上下文窗口。
- 纯 CPU 推理:无需 GPU/NPU,降低基础设施成本和能耗。
- 结果一致性:推理输出与 GPU 基础结果保持一致。
相关
- 项目
- 项目
- 项目
- 项目
- 项目