lightseekorg/tokenspeed
TokenSpeed is a speed-of-light LLM inference engine.
What it solves
TokenSpeed는 에이전트 워크로드에 대한 LLM 추론 성능 병목 현상을 해결하도록 설계되었습니다. TensorRT‑LLM의 높은 성능과 vLLM의 사용 편의성을 결합하는 것을 목표로 합니다.
How it works
TokenSpeed는 추론을 최적화하기 위해 여러 핵심 구성 요소를 사용합니다:
- Modeling layer: 로컬‑SPMD 설계와 집합 통신을 자동으로 생성하는 정적 컴파일러를 사용하여 사용자가 직접 병렬 로직을 작성할 필요를 없앱니다.
- Scheduler: C++ 제어 플레인과 Python 실행 플레인을 결합해 요청 라이프사이클과 KV 캐시 소유권을 유한 상태 머신으로 관리합니다.
- Kernels: 중앙 레지스트리를 갖춘 플러그인형 계층형 커널 시스템을 제공하며, Blackwell GPU용 고성능 Multi‑head Latent Attention (MLA) 구현을 포함합니다.
- Entrypoint: SMG와 통합된 AsyncLLM을 활용해 CPU 측 요청 처리 오버헤드를 최소화합니다.
Who it’s for
극한의 추론 속도와 높은 처리량을 필요로 하는 프로덕션급 에이전트 워크로드를 배포하는 개발자와 조직을 대상으로 합니다.
Highlights
- 에이전트 워크로드에서 높은 성능을 발휘하며 Qwen3.5‑397B‑A17B에서 최대 580 TPS를 달성했습니다.
- NVIDIA 및 AMD 하드웨어에서 FP4 추론을 지원합니다.
- 정적 컴파일러를 통한 자동 병렬 로직 생성.
- 컴파일 시 강제되는 KV 캐시 자원 재사용 최적화.