tile-ai/TileRT
Tile-Based Runtime for Ultra-Low-Latency LLM Inference
What it solves
TileRT は、出力トークンあたりの時間(TPOT)を最小化する必要があるシナリオ向けに、超低レイテンシ LLM 推論を実現するよう設計されています。従来の推論システムが高スループットのバッチ処理を優先し、リアルタイムアプリケーション(高頻度取引、インタラクティブ AI、AI 補助コーディング)に求められる応答性を犠牲にしているというボトルネックを解消します。
How it works
TileRT はコンパイラ駆動のタイルレベルランタイムエンジンを使用します。LLM 演算子を細粒度のタイルタスクに分解し、計算、I/O、通信を複数デバイス間で高度にオーバーラップさせて動的に再スケジューリングし、ハードウェアのアイドル時間を最小化し、利用率を最大化します。
Who it’s for
数千億パラメータ規模の大規模モデルからミリ秒単位の応答性が求められる開発者や組織、特に NVIDIA B200 GPU などのハイエンドハードウェアを使用するケースを対象としています。
Highlights
- Extreme Performance: 1 兆パラメータモデルで、単一 8 GPU ノード上で 1000 トークン/秒を突破可能。
- Multi-Token Prediction (MTP): 1 回のフォワードパスで複数トークンを生成でき、シーケンシャルデコードの深さを削減。
- Model Support: DeepSeek-V3.2 や GLM-5 などのモデル向けに特化したバックエンドを提供。
- Hardware Optimized: NVIDIA B200 クラスタ向けに最適化され、事前構築されたバイナリ wheel と Docker イメージで厳格な ABI 互換性を実現。