jjang-ai/vmlx
vMLX - JANGTQ Uber Compressed MLX Models - L2 Disk Cache (survives restart) + L1 Paged (super fast ttft) + Hybrid SSM Scheduler + Cont Batching + etc!
What it solves
vMLX는 Apple Silicon(M1/M2/M3/M4) 전용으로 설계된 자체 호스팅 추론 서버입니다. 서드파티 API 키 없이 로컬에서 대규모 언어 모델(LLMs), 비전-언어 모델(VLMs) 및 이미지 생성 모델을 실행할 수 있으며, OpenAI, Anthropic, Ollama와 호환되는 HTTP API를 제공합니다.
How it works
이 프로젝트는 MLX 프레임워크를 활용해 Mac 하드웨어에서 성능을 최적화합니다. 메모리 인식 프리픽스 캐시와 디스크 캐시를 포함한 5계층 캐시 아키텍처를 구현하고, 연속 배치, 추측 디코딩, 페이지 KV 캐시와 같은 고급 기술을 지원하여 속도와 메모리 효율성을 높입니다. 단일 머신에 수용하기 어려운 대형 모델의 경우, 여러 대의 Mac을 통한 파이프라인 병렬화를 이용한 분산 추론을 지원합니다.
Who it’s for
Apple Silicon을 사용하는 개발자와 AI 애호가를 위해 제작되었으며, 로컬에서 모델을 직접 호스팅하고 표준 API를 통해 애플리케이션에 통합하거나, Mac 클러스터에서 대규모 모델을 실행하고자 하는 분들에게 적합합니다.
Highlights
- Broad Model Support: Runs text LLMs, vision models, multimodal omni models, MoE, hybrid SSMs, and image generation/editing models (Flux).
- Cros-API Compatibility: Supports OpenAI, Anthropic, and Ollama wire formats.
- Distributed Compute: Ability to split transformer layers across multiple Macs via Thunderbolt, Ethernet, or WiFi.
- Advanced Quantization: Supports standard MLX quantization and JANG adaptive mixed-precision for higher quality at lower bit-widths.
- Integrated Desktop App: Includes MLX Studio for model management, chat UI, and developer tools like GGUF-to-MLX conversion.
- Multimodal Capabilities: Integrated support for text-to-speech (Kokoro) and speech-to-text (Whisper).