lightseekorg/tokenspeed
TokenSpeed is a speed-of-light LLM inference engine.
解决的问题
TokenSpeed 是一个专为代理工作负载优化的高性能 LLM 推理引擎。它旨在提供 TensorRT-LLM 的极致性能,同时保持 vLLM 的易用性和可用性。
工作原理
TokenSpeed 采用控制平面与执行平面之间的独特架构分离:
- 控制平面:使用 C++ 实现为有限状态机,利用类型系统在编译时强制执行安全的资源管理(如 KV 缓存状态和请求生命周期)。
- 执行平面:使用 Python 实现,使开发者能够更快迭代并降低认知负担。
- 建模层:采用本地 SPMD 设计,通过静态编译器根据模块边界放置注解生成集合通信,无需用户手动编写并行逻辑。
- 内核:具备可插拔、分层的内核系统,提供可移植的公共 API 和集中式注册表,包含针对 Blackwell GPU 优化的高效率 MLA(多头潜在注意力)实现。
- 入口点:使用集成 SMG 的 AsyncLLM,实现低开销的 CPU 端请求处理。
适用人群
需要极致推理速度和高效资源管理的生产级代理 AI 系统的研究人员和工程师。
主要亮点
- 平面分离:首个将 C++ 控制平面与 Python 执行平面分离的引擎,兼顾正确性与开发速度。
- 高性能:实现高吞吐量(例如 Qwen3.5-397B-A17B 上达到 580 TPS),在代理工作负载的帕累托曲线上与 TensorRT-LLM 竞争。
- 自动并行化:静态编译器处理集合通信,简化模型部署流程。
- 模块化内核:可插拔内核系统支持异构加速器。
相关
- 项目
- 项目
- 项目
- 项目
- 项目