lightseekorg/tokenspeed

TokenSpeed is a speed-of-light LLM inference engine.

해결하는 문제

TokenSpeed는 에이전트 워크로드에 특별히 최적화된 고성능 LLM 추론 엔진입니다. TensorRT-LLM의 극한적인 성능을 제공하면서도 vLLM의 사용 편의성과 사용성을 유지하려는 목표를 가지고 있습니다.

작동 방식

TokenSpeed는 제어 평면과 실행 평면 간에 독특한 아키텍처 분리를 사용합니다.

  • 제어 평면: C++로 구현된 유한 상태 기계로, 타입 시스템을 사용하여 컴파일 시점에 안전한 리소스 관리(예: KV 캐시 상태 및 요청 라이프사이클)를 강제합니다.
  • 실행 평면: Python으로 구현되어 개발자의 반복 속도를 빠르게 하고 인지 부담을 줄입니다.
  • 모델링 레이어: 로컬-SPMD 설계를 사용하며, 모듈 경계 배치 주석 기반의 정적 컴파일러가 집합적 통신을 생성하여 사용자가 수동으로 병렬화 로직을 작성할 필요가 없습니다.
  • 커널: 플러그인 가능하고 계층적인 커널 시스템을 갖추고 있으며, 포터블한 공개 API와 중앙 집중식 레지스트리를 제공하며, Blackwell GPU용으로 고도로 최적화된 MLA(다중 헤드 잠재 주목적) 구현을 포함합니다.
  • 엔트리포인트: SMG 통합형 AsyncLLM을 사용하여 CPU 측 리퀘스트 처리에 낮은 오버헤드를 실현합니다.

대상 사용자

극한의 추론 속도와 효율적인 리소스 관리가 필요한 프로덕션 수준의 에이전트 AI 시스템을 구축하는 연구자 및 엔지니어.

주요 특징

  • 평면 분리: 정확성과 속도를 동시에 달성하기 위해 C++ 제어 평면과 Python 실행 평면을 분리한 최초의 엔진입니다.
  • 고성능: 높은 처리량(예: Qwen3.5-397B-A17B에서 580 TPS)을 달성하며, 에이전트 워크로드에서 TensorRT-LLM과 파레토 곡선에서 경쟁 가능합니다.
  • 자동 병렬화: 정적 컴파일러가 집합적 통신을 처리하여 모델 배포 과정을 단순화합니다.
  • 모듈형 커널: 플러그인 가능한 커널 시스템으로 이종 가속기 지원이 가능합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트