lucienhuangfu/eLLM

eLLM: Run Long-Horizon Inference Faster on CPUs Than on GPUs

解決的問題

eLLM 是為克服 CPU 在執行大型語言模型(LLM)時的記憶體頻寬瓶頸而設計,特別針對長時程任務。它讓 CPU 伺服器在涉及百萬級令牌上下文視窗與多輪互動的場景中,能比 GPU 更快速地完成推論,從而減少對昂貴且耗電的 GPU 硬體需求。

工作原理

該框架採用「以儲存換運算」的策略,利用 DDR 記憶體的巨大容量,最大限度減少重複計算。關鍵技術實作包括:

  • 彈性靜態計算圖:採用維度優先佈局,使同一執行圖可支援不同輸入長度,無需重建。
  • 靜態形狀 KV 快取:以預先配置的固定形狀張量取代分頁區塊管理,減少元資料開銷並避免快取未命中。
  • 大維度張量:預留大序列維度以支援完整預填入(Prefill),避免超長提示中重複載入參數。
  • 會話快取:在多輪互動中保持 KV 狀態,系統只需增量式地對新輸入進行預填入,而無需重新計算整個歷史。

適用對象

主要針對從事長時程 AI 代理開發的開發者與研究人員,例如電腦操作代理、大型程式碼庫的程式碼協作者、企業知識庫的 RAG 系統,以及需在數小時或數天內維持狀態的深度研究代理。

核心亮點

  • 超越 GPU 的效能:宣稱在長上下文推論與長時程任務中優於 GPU。
  • vLLM API 相容:可直接接入現有 LLM 生態系統。
  • 超長上下文支援:利用 TB 級記憶體,支援百萬級、近乎無限的上下文視窗。
  • 純 CPU 推論:無需 GPU/NPU,降低基礎設施成本與能耗。
  • 結果一致性:推論輸出與 GPU 基礎結果保持一致。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案