lightseekorg/tokenspeed
TokenSpeed is a speed-of-light LLM inference engine.
何を解決するか
TokenSpeed は、エージェントワークロードに特化して最適化された高性能 LLM 推論エンジンです。TensorRT-LLM の極限的なパフォーマンスを提供しつつ、vLLM の使いやすさと使い勝手を維持することを目指しています。
動作方法
TokenSpeed は、制御平面と実行平面の独自のアーキテクチャ分割を採用しています。
- 制御平面: C++ で実装された有限状態機械として、型システムを用いてコンパイル時に安全なリソース管理(KVキャッシュ状態やリクエストライフサイクルなど)を強制します。
- 実行平面: Python で実装されており、開発者のイテレーション速度を高速化し、認知負荷を低減します。
- モデル化レイヤー: ローカル-SPMD設計を採用し、モジュール境界配置のアノテーションに基づいて集団通信を生成する静的コンパイラを使用。ユーザーが並列化ロジックを手動で書く必要がありません。
- カーネル: プラグイン可能で階層的なカーネルシステムを備え、ポータブルな公開 API と中央集権的なレジストリを提供。Blackwell GPU 向けに高度に最適化された MLA(マルチヘッド・ラテンアテンション)実装を含みます。
- エントリポイント: SMG統合型 AsyncLLM を使用し、CPU側のリクエスト処理に低オーバーヘッドを実現します。
対象ユーザー
極限的な推論速度と効率的なリソース管理を必要とする、本番環境向けエージェントAIシステムを構築する研究者およびエンジニア。
主な特徴
- 平面の分離: 正確性と高速性の両立を実現するため、C++ 制御平面と Python 実行平面を分離した初のエンジン。
- 高パフォーマンス: 高スループット(例:Qwen3.5-397B-A17B で 580 TPS)を達成し、エージェントワークロードにおいて TensorRT-LLM とパレート曲線で競合可能。
- 自動並列化: 静的コンパイラが集団通信を処理し、モデルデプロイプロセスを簡素化。
- モジュールカーネル: プラグイン可能なカーネルシステムにより、異種アクセラレータをサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト