tile-ai/TileRT

Tile-Based Runtime for Ultra-Low-Latency LLM Inference

What it solves

TileRT 旨在实现超低延迟的 LLM 推理,特别针对必须最小化每个输出 token 时间(TPOT)的场景。它解决了传统推理系统优先考虑高吞吐量批处理,而忽视实时应用(如高频交易、交互式 AI 与 AI 辅助编码)所需响应性的瓶颈。

How it works

TileRT 使用编译器驱动的瓦片级运行时引擎。它将 LLM 操作符拆分为细粒度的瓦片任务,并在多个设备之间以高度重叠的方式动态重新调度计算、I/O 和通信,以最小化硬件空闲时间并最大化利用率。

Who it’s for

它面向需要毫秒级响应的大规模模型(数千亿参数)开发者和组织,尤其是在 NVIDIA B200 GPU 等高端硬件上。

Highlights

  • Extreme Performance: 能在单个 8-GPU 节点上,以 1 万亿参数模型突破 1000 token/秒。
  • Multi-Token Prediction (MTP): 支持在一次前向传播中生成多个 token,以降低序列解码深度。
  • Model Support: 为 DeepSeek-V3.2、GLM-5 等模型提供专用后端。
  • Hardware Optimized: 专为 NVIDIA B200 集群调优,使用预构建的二进制 wheel 和 Docker 镜像,确保严格的 ABI 兼容性。