lightseekorg/tokenspeed

TokenSpeed is a speed-of-light LLM inference engine.

解決的問題

TokenSpeed 是一個專為代理工作負載優化之高效率 LLM 推論引擎。其目標在於提供 TensorRT-LLM 的極致性能,同時維持 vLLM 的易用性與可用性。

工作原理

TokenSpeed 採用控制平面與執行平面之間獨特的架構分離:

  • 控制平面:以 C++ 實作為有限狀態機,利用類型系統在編譯時期強制執行安全的資源管理(如 KV 快取狀態與請求生命週期)。
  • 執行平面:以 Python 實作,使開發者能更快迭代並降低認知負荷。
  • 建模層:採用本地 SPMD 設計,透過靜態編譯器根據模組邊界放置註解生成集體通訊,無需使用者手動撰寫平行化邏輯。
  • 內核:具備可插入、分層的內核系統,提供可移植的公開 API 與中央註冊表,包含針對 Blackwell GPU 優化之高效 MLA(多頭潛在注意力)實作。
  • 入口點:使用整合 SMG 的 AsyncLLM,實現低開銷的 CPU 端請求處理。

適用對象

需要極致推論速度與高效資源管理之生產級代理 AI 系統的研究人員與工程師。

主要亮點

  • 平面分離:首個將 C++ 控制平面與 Python 執行平面分離的引擎,兼顧正確性與開發速度。
  • 高效率:達成高吞吐量(例如 Qwen3.5-397B-A17B 上達 580 TPS),在代理工作負載的帕累托曲線上與 TensorRT-LLM 競爭。
  • 自動平行化:靜態編譯器處理集體通訊,簡化模型部署流程。
  • 模組化內核:可插入內核系統支援異質加速器。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案