Luce-Org/lucebox

LLM speculative inference server for heterogeneous hardware & consumer GPUs

解決的問題

Lucebox 是一個高效率的推論引擎,專為 NVIDIA GPU、AMD GPU 與 APU(如 Strix Halo)等異質消費級硬體設計,旨在帶來快速且本地化的 LLM 執行。它透過使用推測推論與客製化硬體調校的內核,解決在消費級設備上執行大型模型時的效能瓶頸。

工作原理

引擎採用多項先進的優化技術,以最大化吞吐量並降低延遲:

  • 推測推論:使用較小的「草稿」模型預測詞元,再由較大的目標模型進行驗證,大幅加速解碼過程。
  • 自訂內核:實作針對特定硬體架構(CUDA 與 HIP)優化的專用內核(例如 DFlash、PFlash、KVFlash、Megakernel)。
  • 記憶體管理:採用分頁注意力與連續批次處理,有效處理多個並行請求。
  • 異質執行:支援將模型執行分散至不同類型的硬體(例如 AMD GPU 與 APU 的組合)。

適用對象

適合希望在消費級硬體上以高每秒詞元數運行強大 LLM 的開發者與 AI 愛好者,以及希望透過其 OpenAI 相容 API 將 LLM 整合至程式碼客戶端的使用者。

主要亮點

  • 廣泛的硬體支援:相容 NVIDIA(Ampere、Ada、Blackwell)與 AMD(RDNA3、RDNA4)架構。
  • 高吞吐量:在某些 AMD 硬體上實現顯著加速(例如超過 200 tok/s)。
  • OpenAI 相容 API:可輕鬆整合至各種程式碼客戶端與工具中。
  • 推測預填入與解碼:優化初始提示處理與詞元產生階段。
  • uma-GPU 與混合 GPU 配置檔:提供適用於各種硬體組合的預設設定。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案