tile-ai/TileRT
Tile-Based Runtime for Ultra-Low-Latency LLM Inference
What it solves
TileRT는 출력 토큰당 시간(TPOT)을 최소화하여 응답성을 높여야 하는 시나리오를 위해 설계된 초저지연 LLM 추론 엔진입니다. 개별 요청의 지연 시간을 희생하고 고처리량 배치 처리를 우선시하는 기존 추론 시스템의 한계를 해결하여 고빈도 트레이딩, 인터랙티브 AI, AI 보조 코딩 등 실시간 애플리케이션에 적합합니다.
How it works
TileRT는 타일 수준 런타임 엔진과 컴파일러 기반 접근 방식을 사용해 LLM 연산자를 세밀한 타일 작업으로 분해합니다. 런타임은 여러 디바이스에 걸쳐 계산, I/O, 통신을 동적으로 재스케줄링하여 고도로 겹쳐 실행함으로써 유휴 시간을 최소화하고 하드웨어 활용도를 극대화합니다. 또한 Multi-Token Prediction(MTP)을 지원해 한 번의 포워드 패스에서 여러 토큰을 생성하여 순차 디코딩 깊이를 줄입니다.
Who it’s for
수천억 파라미터 규모의 대형 모델을 배포하고, 고성능 하드웨어(NVIDIA B200 GPU)에서 밀리초 수준의 응답성을 요구하는 개발자와 조직을 대상으로 합니다.
Highlights
- Extreme Performance: 1조 파라미터 모델을 단일 8 GPU 노드에서 초당 1000 토큰 이상 처리 가능.
- PD Disaggregation: prefill‑decode 분리를 지원해 vLLM이 prefill 단계를 담당하고 TileRT가 OpenAI 호환 엔드포인트를 통해 decode 단계를 관리합니다.
- MTP Support: 디코딩 속도 향상을 위해 Multi‑Token Prediction을 통합.
- Model Support: DeepSeek‑V3.2 및 GLM‑5/5.1 모델에 특화되어 최적화되었습니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트