tile-ai/TileRT
Tile-Based Runtime for Ultra-Low-Latency LLM Inference
What it solves
TileRT는 출력 토큰당 시간(TPOT)을 최소화해야 하는 시나리오를 위해 설계된 초저지연 LLM 추론 엔진입니다. 전통적인 추론 시스템이 실시간 애플리케이션(고빈도 트레이딩, 인터랙티브 AI, AI 보조 코딩)에서 요구되는 응답성보다 높은 처리량 배치 처리를 우선시하는 병목 현상을 해결합니다.
How it works
TileRT는 컴파일러 기반 타일 수준 런타임 엔진을 사용합니다. LLM 연산자를 세밀한 타일 작업으로 분해하고, 여러 디바이스에 걸쳐 계산, I/O, 통신을 고도로 겹쳐서 동적으로 재스케줄링함으로써 하드웨어 유휴 시간을 최소화하고 활용도를 극대화합니다.
Who it’s for
수천억 파라미터 규모의 대형 모델에서 밀리초 수준의 응답성을 필요로 하는 개발자와 조직, 특히 NVIDIA B200 GPU와 같은 고성능 하드웨어를 사용하는 경우를 대상으로 합니다.
Highlights
- Extreme Performance: 1조 파라미터 모델을 단일 8‑GPU 노드에서 초당 1000 토큰 이상 처리할 수 있습니다.
- Multi-Token Prediction (MTP): 한 번의 포워드 패스에서 여러 토큰을 생성해 순차 디코딩 깊이를 감소시킵니다.
- Model Support: DeepSeek-V3.2, GLM-5 등 모델에 특화된 백엔드를 제공합니다.
- Hardware Optimized: NVIDIA B200 클러스터에 최적화되어 사전 구축된 바이너리 wheel 및 Docker 이미지로 엄격한 ABI 호환성을 보장합니다.