Luce-Org/lucebox
LLM speculative inference server for heterogeneous hardware & consumer GPUs
해결하는 문제
Lucebox는 NVIDIA GPU, AMD GPU, 그리고 APU(예: Strix Halo)를 포함한 다양한 소비자용 하드웨어에서 빠르고 로컬로 LLM을 실행할 수 있도록 설계된 고성능 추론 엔진입니다. 대규모 모델을 소비자용 장비에서 실행할 때 발생하는 성능 저하 문제를 예측 추론과 맞춤형 하드웨어 최적화 커널을 통해 해결합니다.
작동 방식
엔진은 스루풋을 극대화하고 지연을 줄이기 위해 여러 고급 최적화 기술을 사용합니다:
- 예측 추론: 작은 '드래프트 모델'을 사용해 토큰을 예측하고, 그 결과를 더 큰 타겟 모델로 검증함으로써 디코딩 속도를 크게 향상시킵니다.
- 맞춤형 커널: CUDA 및 HIP용으로 특정 하드웨어 아키텍처에 최적화된 전용 커널(예: DFlash, PFlash, KVFlash, Megakernel)을 구현합니다.
- 메모리 관리: 페이지 기반 어텐션과 연속 배치를 사용해 여러 동시 요청을 효율적으로 처리합니다.
- 이종 실행: 다양한 유형의 하드웨어(예: AMD GPU와 APU 조합) 간에 모델 실행을 분산할 수 있습니다.
대상 사용자
고 토큰/초 속도로 소비자용 하드웨어에서 강력한 LLM을 로컬로 실행하고 싶은 개발자 및 AI 애호가, 그리고 OpenAI 호환 API를 통해 코드 클라이언트에 LLM을 통합하고자 하는 사용자에게 적합합니다.
주요 특징
- 광범위한 하드웨어 지원: NVIDIA(Ampere, Ada, Blackwell) 및 AMD(RDNA3, RDNA4) 아키텍처와 호환됩니다.
- 고스루풋: 특정 AMD 하드웨어에서 200 tok/s 이상의 빠른 속도를 달성합니다.
- OpenAI 호환 API: 다양한 코드 클라이언트 및 활용 도구에 쉽게 통합할 수 있습니다.
- 예측 프리필 및 디코딩: 초기 프롬프트 처리와 토큰 생성 단계 모두를 최적화합니다.
- uma-GPU 및 믹스 GPU 프로필: 다양한 하드웨어 조합을 위한 사전 구성된 설정을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트