lightseekorg/tokenspeed

TokenSpeed is a speed-of-light LLM inference engine.

解决的问题

TokenSpeed 是一个专为代理工作负载优化的高性能 LLM 推理引擎。它旨在提供 TensorRT-LLM 的极致性能,同时保持 vLLM 的易用性和可用性。

工作原理

TokenSpeed 采用控制平面与执行平面之间的独特架构分离:

  • 控制平面:使用 C++ 实现为有限状态机,利用类型系统在编译时强制执行安全的资源管理(如 KV 缓存状态和请求生命周期)。
  • 执行平面:使用 Python 实现,使开发者能够更快迭代并降低认知负担。
  • 建模层:采用本地 SPMD 设计,通过静态编译器根据模块边界放置注解生成集合通信,无需用户手动编写并行逻辑。
  • 内核:具备可插拔、分层的内核系统,提供可移植的公共 API 和集中式注册表,包含针对 Blackwell GPU 优化的高效率 MLA(多头潜在注意力)实现。
  • 入口点:使用集成 SMG 的 AsyncLLM,实现低开销的 CPU 端请求处理。

适用人群

需要极致推理速度和高效资源管理的生产级代理 AI 系统的研究人员和工程师。

主要亮点

  • 平面分离:首个将 C++ 控制平面与 Python 执行平面分离的引擎,兼顾正确性与开发速度。
  • 高性能:实现高吞吐量(例如 Qwen3.5-397B-A17B 上达到 580 TPS),在代理工作负载的帕累托曲线上与 TensorRT-LLM 竞争。
  • 自动并行化:静态编译器处理集合通信,简化模型部署流程。
  • 模块化内核:可插拔内核系统支持异构加速器。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目