jundot/omlx
LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar
해결하는 문제
oMLX는 Apple Silicon Mac에 특화된 고성능 LLM 추론 서버입니다. 편의성과 제어력 사이의 트레이드오프를 해결하기 위해, 사용자가 모델을 메모리에 고정하거나 필요 시 무거운 모델을 자동 스왑할 수 있으며, 네이티브 macOS 메뉴바 앱을 통해 서버 전체를 관리할 수 있는 관리 환경을 제공합니다.
작동 방식
이 프로젝트는 vLLM에서 영감을 받은 계층형 KV(Key-Value) 캐시 시스템을 사용합니다. 이 시스템은 빠른 접근을 위한 "핫" RAM 계층과 재시작 또는 컨텍스트 변경 후에도 컨텍스트를 지속적으로 유지하기 위한 "콜드" SSD 계층으로 저장소를 분리합니다. mlx-lm을 통한 연속 배치 처리를 통해 동시 요청을 처리하고, 외부 도구와의 통합을 용이하게 하는 OpenAI/Anthropic 호환 API를 제공합니다. 고급 사용자를 위해 실험적인 다중 Mac 추론을 지원하여, 라인 또는 Thunderbolt RDMA를 통한 파이프라인 랭크를 사용해 단일 모델을 여러 Mac에 분할할 수 있습니다.
대상 사용자
코드 어시스턴트(Claude Code 등)를 사용하는 macOS 사용자, 개발자 및 고급 사용자로서 로컬 LLM, VLM, 임베딩 모델을 프로페셔널 수준의 메모리 관리와 높은 처리량으로 실행하고자 하는 분들입니다.
주요 특징
- 계층형 KV 캐시: RAM과 SSD 간에 대화 컨텍스트를 지속적으로 유지하여 프롬프트 재계산을 방지합니다.
- 네이티브 macOS 통합: Swift 기반 메뉴바 앱을 통해 터미널 없이 모니터링 및 서버 제어가 가능합니다.
- 다중 모델 서빙: LLM, VLM, OCR 모델, 리랭커를 동시에 로드할 수 있으며, LRU 제거 및 모델 핀 고정을 지원합니다.
- 관리자 대시보드: HuggingFace에서 모델 다운로드, 벤치마킹, 모델별 설정을 가능하게 하는 포괄적인 웹 UI.
- API 호환성: OpenAI 및 Anthropic API의 드롭인 대체품으로, 도구 호출 및 MCP(Model Context Protocol) 통합도 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트