tile-ai/TileRT
Tile-Based Runtime for Ultra-Low-Latency LLM Inference
What it solves
TileRT は、出力トークンあたりの時間(TPOT)を最小化して応答性を高める必要があるシナリオ向けに設計された、超低遅延 LLM 推論用エンジンです。従来の推論システムが高スループットのバッチ処理を優先し、個別リクエストのレイテンシを犠牲にしている問題を解決し、高頻度取引、インタラクティブ AI、AI 補助コーディングなどのリアルタイムアプリケーションに適しています。
How it works
TileRT はタイルレベルのランタイムエンジンとコンパイラ駆動のアプローチを用いて、LLM 演算子を細粒度のタイルタスクに分解します。ランタイムは複数デバイス間で計算、I/O、通信を動的に再スケジューリングし、高度にオーバーラップさせてアイドル時間を最小化し、ハードウェア利用率を最大化します。また、Multi-Token Prediction(MTP)をサポートし、1 回のフォワードパスで複数トークンを生成してシーケンシャルデコードの深さを削減します。
Who it’s for
数千億パラメータ規模の巨大モデルをデプロイし、高性能ハードウェア(特に NVIDIA B200 GPU)上でミリ秒単位の応答性が求められる開発者や組織向けです。
Highlights
- Extreme Performance: 1 兆パラメータモデルで、単一 8 GPU ノード上で 1000 トークン/秒を突破可能。
- PD Disaggregation: prefill‑decode の分離をサポートし、vLLM が prefill フェーズを処理し、TileRT が OpenAI 互換エンドポイント経由で decode フェーズを管理します。
- MTP Support: デコードレート向上のために Multi‑Token Prediction を統合。
- Model Support: DeepSeek‑V3.2 と GLM‑5/5.1 モデルに特化して最適化。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト