tile-ai/TileRT
Tile-Based Runtime for Ultra-Low-Latency LLM Inference
What it solves
TileRT 是為了超低延遲的 LLM 推理而設計,特別針對必須最小化每個輸出 token 時間(TPOT)的情境。它解決了傳統推理系統將高吞吐量批次處理置於首位,而忽視即時應用(如高頻交易、互動式 AI 與 AI 輔助程式碼)所需回應性的瓶頸。
How it works
TileRT 使用編譯器驅動的瓦片層級執行時引擎。它將 LLM 運算子分解為細粒度的瓦片任務,並在多個裝置之間以高度重疊的方式動態重新排程計算、I/O 與通信,以最小化硬體閒置時間並最大化利用率。
Who it’s for
此引擎適用於需要毫秒級回應的大規模模型(數千億參數)開發者與組織,尤其是在 NVIDIA B200 GPU 等高階硬體上。
Highlights
- Extreme Performance: 能在單一 8-GPU 節點上,以 1 兆參數模型突破 1000 token/秒。
- Multi-Token Prediction (MTP): 支援在一次前向傳播中產生多個 token,以降低序列解碼深度。
- Model Support: 提供 DeepSeek-V3.2、GLM-5 等模型的專屬後端。
- Hardware Optimized: 專為 NVIDIA B200 叢集調校,使用預建的二進位 wheel 與 Docker 映像,確保嚴格的 ABI 相容性。