Blaizzy/mlx-vlm

MLX-VLM is a package for inference and fine-tuning of Vision Language Models (VLMs) on your Mac using MLX.

解决的问题

MLX-VLM 提供了一种简化流程的方法,专门针对使用 MLX 框架的 Apple Silicon Mac 进行了优化,用于运行和微调视觉语言模型 (VLMs) 和全模态模型(支持音频和视频)。它简化了在本地高性能部署这些复杂多模态模型的流程。

工作原理

该软件包利用 MLX 框架来实现高效的推理和微调。它提供了多种交互接口,包括命令行界面 (CLI)、Python API、基于 Gradio 的聊天 UI 以及 FastAPI 服务器。为了提高生成速度,它实现了使用各种 drafter 系列(如 DFlash、EAGLE-3 和 Multi-Token Prediction (MTP))的投机解码 (speculative decoding)。

适用对象

使用 Mac 硬件并希望部署、测试或微调能够处理文本、图像、音频和视频的多模态模型的开发人员和 AI 研究人员。

亮点

  • 多模态支持:处理广泛支持的模型(例如 Qwen、Gemma、MiniCPM)中的文本、图像、音频和视频输入。
  • 加速推理:支持投机解码 (DFlash、EAGLE-3、MTP),可显著提高 Token 吞吐量。
  • 生产级服务器:包含具有连续批处理 (continuous batching)、自动前缀缓存和 KV 缓存量化功能的 FastAPI 服务器。
  • 思考模式:支持“思考”模型(如 Qwen3.5),并为推理块提供可配置的 Token 预算。
  • 本地优化:专为 MLX 设计,以最大化 Apple Silicon 的性能。