lightseekorg/tokenspeed

TokenSpeed is a speed-of-light LLM inference engine.

What it solves

TokenSpeed はエージェントワークロード向けに LLM 推論のパフォーマンスボトルネックを解消することを目的として設計されています。TensorRT‑LLM の高性能と vLLM の使いやすさを組み合わせることを目指しています。

How it works

TokenSpeed は推論を最適化するためにいくつかのコアコンポーネントを採用しています:

  • Modeling layer: ローカル‑SPMD 設計と、集団通信を自動生成する静的コンパイラを使用し、ユーザーが並列ロジックを手動で記述する必要をなくします。
  • Scheduler: C++ 制御平面と Python 実行平面を組み合わせ、リクエストのライフサイクルと KV キャッシュの所有権を有限状態機械で管理します。
  • Kernels: 中央レジストリを持つプラガブルで階層化されたカーネルシステムを提供し、Blackwell GPU 用の高性能 Multi‑head Latent Attention (MLA) 実装を含みます。
  • Entrypoint: SMG 統合 AsyncLLM を利用し、CPU 側のリクエスト処理のオーバーヘッドを低減します。

Who it’s for

本プロジェクトは、極限の推論速度と高スループットを必要とする本番環境のエージェントワークロードを展開する開発者や組織を対象としています。

Highlights

  • エージェントワークロードで高性能を実現し、Qwen3.5‑397B‑A17B で最大 580 TPS を達成。
  • NVIDIA および AMD ハードウェア上での FP4 推論をサポート。
  • 静的コンパイラによる自動並列ロジック生成。
  • コンパイル時に強制される KV キャッシュ資源の最適再利用。