tile-ai/TileRT
Tile-Based Runtime for Ultra-Low-Latency LLM Inference
What it solves
TileRT 旨在实现超低延迟的 LLM 推理,特别针对必须将每个输出 token 的时间(TPOT)降到最低以提升响应速度的场景。它解决了传统推理系统侧重高吞吐量批处理而忽视单个请求延迟的局限,使其适用于高频交易、交互式 AI 和 AI 辅助编码等实时应用。
How it works
TileRT 使用瓦片级运行时引擎,并采用编译器驱动的方法将 LLM 操作符拆解为细粒度的瓦片任务。运行时会在多设备之间动态重新调度计算、I/O 和通信,以高度重叠的方式最小化空闲时间并最大化硬件利用率。它还支持 Multi-Token Prediction(MTP),能够在一次前向传播中生成多个 token,降低顺序解码深度。
Who it’s for
它面向部署数千亿参数大模型、并在高端硬件(尤其是 NVIDIA B200 GPU)上需要毫秒级响应的开发者和组织。
Highlights
- Extreme Performance: 能在单个 8 GPU 节点上,以 1 万亿参数模型突破 1000 token/秒。
- PD Disaggregation: 支持 prefill‑decode 分离,让 vLLM 处理 prefill 阶段,TileRT 通过兼容 OpenAI 的端点管理 decode 阶段。
- MTP Support: 集成 Multi‑Token Prediction 提升解码速率。
- Model Support: 专为 DeepSeek‑V3.2 和 GLM‑5/5.1 模型进行优化。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目