tile-ai/TileRT
Tile-Based Runtime for Ultra-Low-Latency LLM Inference
What it solves
TileRT 是為了超低延遲的 LLM 推理而設計,特別針對必須將每個輸出 token 的時間(TPOT)降到最低以提升回應速度的情境。它解決了傳統推理系統偏好高吞吐量批次處理而忽視單一請求延遲的限制,使其適用於高頻交易、互動式 AI、以及 AI 輔助程式編寫等即時應用。
How it works
TileRT 使用瓦片層級的執行引擎,並採用編譯器驅動的方式將 LLM 運算子分解為細粒度的瓦片任務。執行時會在多個裝置之間動態重新排程計算、I/O 與通訊,以高度重疊的方式減少閒置時間並最大化硬體利用率。它亦支援 Multi-Token Prediction(MTP),可在一次前向傳播中產生多個 token,降低序列解碼深度。
Who it’s for
此引擎適合部署數百億參數大型模型、且在高階硬體(尤其是 NVIDIA B200 GPU)上需要毫秒級回應的開發者與組織。
Highlights
- Extreme Performance: 能在單一 8 GPU 節點上,以 1 兆參數模型突破 1000 token/秒。
- PD Disaggregation: 支援 prefill‑decode 分離,讓 vLLM 處理 prefill 階段,TileRT 透過相容 OpenAI 的端點管理 decode 階段。
- MTP Support: 整合 Multi‑Token Prediction 以提升解碼速率。
- Model Support: 專為 DeepSeek‑V3.2 與 GLM‑5/5.1 模型進行最佳化。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案