lightseekorg/tokenspeed
TokenSpeed is a speed-of-light LLM inference engine.
What it solves
TokenSpeed 旨在解决 LLM 推理的性能瓶颈,特别是针对代理工作负载。它的目标是将 TensorRT‑LLM 的高性能与 vLLM 的易用性相结合。
How it works
TokenSpeed 采用多个核心组件来优化推理:
- Modeling layer:使用本地‑SPMD 设计和静态编译器自动生成集合通信,免去用户手动编写并行逻辑的需求。
- Scheduler:结合 C++ 控制平面和 Python 执行平面,通过有限状态机管理请求生命周期和 KV 缓存所有权。
- Kernels:提供可插拔、分层的内核系统和集中式注册表,包含针对 Blackwell GPU 的高性能 Multi‑head Latent Attention (MLA) 实现。
- Entrypoint:利用 SMG 集成的 AsyncLLM,实现低开销的 CPU 端请求处理。
Who it’s for
它面向需要极致推理速度和高吞吐量的生产级代理工作负载的开发者和组织。
Highlights
- 在代理工作负载上表现出色,在 Qwen3.5‑397B‑A17B 上实现最高 580 TPS。
- 支持在 NVIDIA 与 AMD 硬件上进行 FP4 推理。
- 通过静态编译器自动生成并行逻辑。
- 编译时强制的 KV 缓存资源复用优化。