Luce-Org/lucebox
LLM speculative inference server for heterogeneous hardware & consumer GPUs
解決的問題
Lucebox 是一個高效率的推論引擎,專為 NVIDIA GPU、AMD GPU 與 APU(如 Strix Halo)等異質消費級硬體設計,旨在帶來快速且本地化的 LLM 執行。它透過使用推測推論與客製化硬體調校的內核,解決在消費級設備上執行大型模型時的效能瓶頸。
工作原理
引擎採用多項先進的優化技術,以最大化吞吐量並降低延遲:
- 推測推論:使用較小的「草稿」模型預測詞元,再由較大的目標模型進行驗證,大幅加速解碼過程。
- 自訂內核:實作針對特定硬體架構(CUDA 與 HIP)優化的專用內核(例如 DFlash、PFlash、KVFlash、Megakernel)。
- 記憶體管理:採用分頁注意力與連續批次處理,有效處理多個並行請求。
- 異質執行:支援將模型執行分散至不同類型的硬體(例如 AMD GPU 與 APU 的組合)。
適用對象
適合希望在消費級硬體上以高每秒詞元數運行強大 LLM 的開發者與 AI 愛好者,以及希望透過其 OpenAI 相容 API 將 LLM 整合至程式碼客戶端的使用者。
主要亮點
- 廣泛的硬體支援:相容 NVIDIA(Ampere、Ada、Blackwell)與 AMD(RDNA3、RDNA4)架構。
- 高吞吐量:在某些 AMD 硬體上實現顯著加速(例如超過 200 tok/s)。
- OpenAI 相容 API:可輕鬆整合至各種程式碼客戶端與工具中。
- 推測預填入與解碼:優化初始提示處理與詞元產生階段。
- uma-GPU 與混合 GPU 配置檔:提供適用於各種硬體組合的預設設定。
相關
- 專案
- 專案
- 專案
- 專案
- 專案