tile-ai/TileRT

Tile-Based Runtime for Ultra-Low-Latency LLM Inference

What it solves

TileRT 是為了超低延遲的 LLM 推理而設計,特別針對必須最小化每個輸出 token 時間(TPOT)的情境。它解決了傳統推理系統將高吞吐量批次處理置於首位,而忽視即時應用(如高頻交易、互動式 AI 與 AI 輔助程式碼)所需回應性的瓶頸。

How it works

TileRT 使用編譯器驅動的瓦片層級執行時引擎。它將 LLM 運算子分解為細粒度的瓦片任務,並在多個裝置之間以高度重疊的方式動態重新排程計算、I/O 與通信,以最小化硬體閒置時間並最大化利用率。

Who it’s for

此引擎適用於需要毫秒級回應的大規模模型(數千億參數)開發者與組織,尤其是在 NVIDIA B200 GPU 等高階硬體上。

Highlights

  • Extreme Performance: 能在單一 8-GPU 節點上,以 1 兆參數模型突破 1000 token/秒。
  • Multi-Token Prediction (MTP): 支援在一次前向傳播中產生多個 token,以降低序列解碼深度。
  • Model Support: 提供 DeepSeek-V3.2、GLM-5 等模型的專屬後端。
  • Hardware Optimized: 專為 NVIDIA B200 叢集調校,使用預建的二進位 wheel 與 Docker 映像,確保嚴格的 ABI 相容性。