Luce-Org/lucebox

LLM speculative inference server for heterogeneous hardware & consumer GPUs

解决的问题

Lucebox 是一个高性能推理引擎,旨在为包括 NVIDIA GPU、AMD GPU 和 APU(如 Strix Halo)在内的异构消费级硬件带来快速、本地化的 LLM 执行。它通过使用推测推理和定制的硬件调优内核,解决了在消费级设备上运行大模型时的性能瓶颈。

工作原理

该引擎采用多种高级优化技术,以最大化吞吐量并降低延迟:

  • 推测推理:使用较小的「草稿」模型预测令牌,然后由更大的目标模型验证,显著加速解码过程。
  • 自定义内核:实现针对特定硬件架构(CUDA 和 HIP)优化的专用内核(如 DFlash、PFlash、KVFlash、Megakernel)。
  • 内存管理:采用分页注意力和连续批处理,高效处理多个并发请求。
  • 异构执行:支持在不同类型的硬件(如 AMD GPU 和 APU 的组合)之间分布模型执行。

适用人群

适用于希望在消费级硬件上以高每秒令牌数运行强大 LLM 的开发者和 AI 爱好者,以及希望通过其 OpenAI 兼容 API 将 LLM 集成到代码客户端中的用户。

主要亮点

  • 广泛的硬件支持:兼容 NVIDIA(Ampere、Ada、Blackwell)和 AMD(RDNA3、RDNA4)架构。
  • 高吞吐量:在某些 AMD 硬件上实现显著加速(例如超过 200 tok/s)。
  • OpenAI 兼容 API:可轻松集成到各种代码客户端和工具中。
  • 推测预填充和解码:优化了初始提示处理和令牌生成阶段。
  • uma-GPU 和混合 GPU 配置文件:提供适用于各种硬件组合的预配置设置。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目