snowflakedb/ArcticInference

ArcticInference: vLLM plugin for high-throughput, low-latency inference

해결하는 문제

Arctic Inference는 대규모 언어 모델(LLM) 및 임베딩 추론의 성능 병목을 해결하며, 특히 지연 시간을 줄이고 처리량을 높이는 데 초점을 맞춥니다. 요청 처리 및 토큰 생성 방식을 최적화함으로써 이러한 모델을 더 비용 효율적으로 배포할 수 있도록 합니다.

작동 방식

vLLM의 플러그인으로 작동하며, 엔진을 자동으로 패치하여 여러 고성능 최적화를 구현합니다:

  • 고도화된 병렬 처리: Shift Parallelism과 Arctic Ulysses(시퀀스 병렬 처리)를 구현하여 긴 컨텍스트를 처리하고 효율성을 향상시킵니다.
  • 예측적 디코딩: Arctic Speculator와 Suffix Decoding을 사용하여 토큰 생성 속도를 높입니다.
  • 모델 최적화: SwiftKV를 통합하여 추론 비용을 감소시킵니다.
  • 특화된 최적화: 임베딩 모델 및 추론 작업에 특화된 성능 향상 기능을 포함합니다.

대상 사용자

이 프로젝트는 이미 vLLM을 사용 중인 개발자 및 기업 AI 팀을 대상으로 하며, 기존 API나 CLI 워크플로우를 변경하지 않고도 LLM 및 임베딩 배포에서 더 높은 처리량과 낮은 지연을 달성하고자 하는 사람들에게 적합합니다.

주요 특징

  • vLLM 통합: vLLM API와 호환되며, 원활한 플러그인 형태로 작동합니다.
  • 매우 빠른 성능 향상: LLM의 경우 요청 완료 속도가 최대 3.4배 빨라지고, 임베딩의 경우 최대 16배 빠른 처리량을 제공한다고 주장합니다.
  • "트리펙타": 응답 시간(프리필), 요청당 생성 속도, 전체 통합 처리량을 동시에 개선합니다.
  • 포괄적인 최적화 패키지: 병렬 처리, 예측적 디코딩, KV 캐시 최적화를 하나의 패키지로 통합했습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트