jjang-ai/vmlx

vMLX - JANGTQ Uber Compressed MLX Models - L2 Disk Cache (survives restart) + L1 Paged (super fast ttft) + Hybrid SSM Scheduler + Cont Batching + etc!

What it solves

vMLX は Apple Silicon(M1/M2/M3/M4)専用に設計されたセルフホスト型推論サーバーです。サードパーティの API キーを必要とせずに、ローカルで大規模言語モデル(LLMs)、ビジョン・ランゲージモデル(VLMs)、画像生成モデルを実行でき、OpenAI、Anthropic、Ollama 互換の HTTP API を提供します。

How it works

本プロジェクトは MLX フレームワークを活用し、Mac ハードウェア上でのパフォーマンスを最適化します。メモリ感知プレフィックスキャッシュとディスクキャッシュを含む 5 層キャッシュアーキテクチャを実装し、連続バッチ処理、推測デコード、ページング KV キャッシュといった高度な手法をサポートして速度とメモリ効率を向上させます。単一マシンで収まりきらない大規模モデルについては、複数の Mac 間でパイプライン並列化による分散推論をサポートします。

Who it’s for

Apple Silicon を使用する開発者や AI エンスージアスト向けに作られており、ローカルでモデルをホストしたい、標準 API を通じてアプリに統合したい、または Mac クラスタ上で大規模モデルを走らせたい方に最適です。

Highlights

  • Broad Model Support: Runs text LLMs, vision models, multimodal omni models, MoE, hybrid SSMs, and image generation/editing models (Flux).
  • Cros-API Compatibility: Supports OpenAI, Anthropic, and Ollama wire formats.
  • Distributed Compute: Ability to split transformer layers across multiple Macs via Thunderbolt, Ethernet, or WiFi.
  • Advanced Quantization: Supports standard MLX quantization and JANG adaptive mixed-precision for higher quality at lower bit-widths.
  • Integrated Desktop App: Includes MLX Studio for model management, chat UI, and developer tools like GGUF-to-MLX conversion.
  • Multimodal Capabilities: Integrated support for text-to-speech (Kokoro) and speech-to-text (Whisper).