openinfer-project/openinfer

Pure Rust + CUDA LLM inference engine — no PyTorch, OpenAI-compatible, serves Qwen3 to Kimi-K2

해결하는 문제

openinfer는 PyTorch 또는 ONNX와 같은 무거운 모델 프레임워크 런타임과 관련된 오버헤드를 제거하도록 설계된 고성능 LLM 추론 엔진입니다. 이러한 의존성을 제거함으로써 훨씬 빠른 콜드 스타트 시간, 더 작은 메모리 점유율, 그리고 멀티턴 채팅 및 에이전트 워크플로우를 위한 감소된 지연 시간을 달성합니다.

작동 원리

전체적으로 Rust와 CUDA로 구축된 이 엔진은 수동으로 작성된 커널과 커스텀 스케줄러를 사용합니다. CUDA Graphs를 활용하여 디코드 경로의 커널 실행 오버헤드를 제거하며, openinfer-kv-offload를 통한 계층형 KV 캐시 시스템을 채택하여 축출된 접두사를 재계산하는 대신 호스트 DRAM에서 복원할 수 있습니다. 특정 모델의 경우 Triton AOT 커널, paged attention을 위한 FlashInfer, 그리고 멀티 GPU 통신을 위한 NCCL을 통합합니다.

대상

Python 기반 런타임의 부담 없이 최첨단 규모의 모델에 대해 최소한의 시작 지연 시간, 낮은 상주 메모리 사용량 및 높은 처리량을 요구하는 프로덕션 등급의 LLM 서비스를 구축하는 개발자 및 엔지니어.

주요 특징

  • 제로 프레임워크 런타임: PyTorch 또는 ONNX 없음; 기본 빌드에 순수 Rust 및 CUDA 사용.
  • 신속한 시작: vLLM과 같은 프레임워크에서 훨씬 더 긴 시간이 걸리는 것과 비교하여 약 3초 만에 콜드 스타트 완료.
  • 낮은 메모리 점유율: 유휴 상태일 때 vLLM 대비 약 5배 작은 상주 메모리 사용량.
  • 최첨단 모델 지원: Qwen3, Qwen3.5, DeepSeek-V2-Lite 및 1조 개의 파라미터를 가진 Kimi-K2를 포함한 모델 지원.
  • OpenAI 호환: 쉬운 통합을 위해 /v1/completions 엔드포인트를 제공합니다.