lablup/mlxcel
High-performance LLM/VLM inference runtime and server for Apple Silicon / NVIDIA CUDA devices
해결하는 문제
mlxcel은 대규모 언어 모델(LLM) 및 시각-언어 모델(VLM)을 배포할 때 Python 환경이 필요 없도록 설계된 고성능 추론 런타임 및 서버입니다. 단일 프로세스 내에서 네이티브로 실행되는 환경을 제공하여 배포, 패키징, 서비스 모니터링을 간소화하면서도 Python 기반 MLX 참조와 동등한 성능을 유지합니다.
작동 방식
Rust로 구현된 mlxcel은 네이티브 MLX C++ 바인딩을 사용하여 모델을 실행합니다. Apple Silicon, NVIDIA CUDA 호환 장치, 실험적 OpenXLA 호환 장치를 지원합니다. 런타임은 모델 로딩, 스케줄링, 추론을 단일 네이티브 프로세스 내에서 처리하여 mlx-community 체크포인트에서 직접 모델을 실행할 수 있도록 하며, 변환 단계가 필요하지 않습니다.
대상 사용자
최소한의 오버헤드로 로컬 또는 소규모 클러스터 추론 서버를 배포하고자 하는 개발자 및 운영자, llama.cpp에서 이전하는 사용자(OpenAI 호환 API와 유사한 플래그 구조로 인해), Apple Silicon 또는 NVIDIA GPU 사용자에게 적합합니다.
주요 특징
- 네이티브 성능:
mlx-lm및mlx-vlm과 거의 동등한 디코딩 스루풋을 달성하며, 짧은 프롬프트 텍스트의 프리필이 훨씬 빠릅니다. - 광범위한 모델 지원: Llama, Qwen, Gemma, Phi, Mistral, DeepSeek 등 다양한 텍스트 및 시각-언어 모델 패밀리를 지원합니다.
- OpenAI 호환성:
/v1/chat/completions,/v1/completions,/v1/responses에 대한 OpenAI 호환 HTTP API를 제공합니다. - 프로덕션 준비 기능: 지속적 배치, 프롬프트 프리픽스 캐싱, 사전 추론, KV 캐시 압축을 포함합니다.
- 모델 수술: 재학습 없이 중량 공간에서의 변경(스케일링, 추가, 제거, 교체, 보간)을 YAML 로드 시점에서 직접 수행할 수 있는 1급 기능을 제공합니다.
- 분산 추론: 특정 모델 패밀리에 대해 텐서 병렬 및 파이프라인 병렬을 구현합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트