lightseekorg/tokenspeed

TokenSpeed is a speed-of-light LLM inference engine.

何を解決するか

TokenSpeed は、エージェントワークロードに特化して最適化された高性能 LLM 推論エンジンです。TensorRT-LLM の極限的なパフォーマンスを提供しつつ、vLLM の使いやすさと使い勝手を維持することを目指しています。

動作方法

TokenSpeed は、制御平面と実行平面の独自のアーキテクチャ分割を採用しています。

  • 制御平面: C++ で実装された有限状態機械として、型システムを用いてコンパイル時に安全なリソース管理(KVキャッシュ状態やリクエストライフサイクルなど)を強制します。
  • 実行平面: Python で実装されており、開発者のイテレーション速度を高速化し、認知負荷を低減します。
  • モデル化レイヤー: ローカル-SPMD設計を採用し、モジュール境界配置のアノテーションに基づいて集団通信を生成する静的コンパイラを使用。ユーザーが並列化ロジックを手動で書く必要がありません。
  • カーネル: プラグイン可能で階層的なカーネルシステムを備え、ポータブルな公開 API と中央集権的なレジストリを提供。Blackwell GPU 向けに高度に最適化された MLA(マルチヘッド・ラテンアテンション)実装を含みます。
  • エントリポイント: SMG統合型 AsyncLLM を使用し、CPU側のリクエスト処理に低オーバーヘッドを実現します。

対象ユーザー

極限的な推論速度と効率的なリソース管理を必要とする、本番環境向けエージェントAIシステムを構築する研究者およびエンジニア。

主な特徴

  • 平面の分離: 正確性と高速性の両立を実現するため、C++ 制御平面と Python 実行平面を分離した初のエンジン。
  • 高パフォーマンス: 高スループット(例:Qwen3.5-397B-A17B で 580 TPS)を達成し、エージェントワークロードにおいて TensorRT-LLM とパレート曲線で競合可能。
  • 自動並列化: 静的コンパイラが集団通信を処理し、モデルデプロイプロセスを簡素化。
  • モジュールカーネル: プラグイン可能なカーネルシステムにより、異種アクセラレータをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト