lightseekorg/tokenspeed
TokenSpeed is a speed-of-light LLM inference engine.
What it solves
TokenSpeed 旨在解決 LLM 推理的效能瓶頸,特別是針對代理工作負載。它的目標是將 TensorRT‑LLM 的高效能與 vLLM 的易用性相結合。
How it works
TokenSpeed 採用多個核心元件來最佳化推理:
- Modeling layer:使用本地‑SPMD 設計與靜態編譯器自動產生集合通信,免除使用者手動撰寫平行化邏輯的需求。
- Scheduler:結合 C++ 控制平面與 Python 執行平面,透過有限狀態機管理請求生命週期與 KV 快取所有權。
- Kernels:提供可插拔、分層的核心系統與集中式註冊表,包含針對 Blackwell GPU 的高效能 Multi‑head Latent Attention (MLA) 實作。
- Entrypoint:利用 SMG 整合的 AsyncLLM,實現低開銷的 CPU 端請求處理。
Who it’s for
它的目標對象是需要極致推論速度與高吞吐量的生產級代理工作負載的開發者與組織。
Highlights
- 在代理工作負載上展現高效能,在 Qwen3.5‑397B‑A17B 上達到最高 580 TPS。
- 支援在 NVIDIA 與 AMD 硬體上執行 FP4 推論。
- 透過靜態編譯器自動產生平行化邏輯。
- 編譯時即強制的 KV 快取資源重複使用最佳化。