Blaizzy/mlx-vlm
MLX-VLM is a package for inference and fine-tuning of Vision Language Models (VLMs) on your Mac using MLX.
解決的問題
MLX-VLM 提供了一種簡化流程的方法,專門針對使用 MLX 框架的 Apple Silicon Mac 進行了優化,用於執行與微調視覺語言模型 (VLMs) 和全模態模型(支援音訊與影片)。它簡化了在本地高效能部署這些複雜多模態模型的流程。
工作原理
該套件利用 MLX 框架來實現高效的推理與微調。它提供了多種互動介面,包括命令列介面 (CLI)、Python API、基於 Gradio 的聊天 UI 以及 FastAPI 伺服器。為了提高生成速度,它實現了使用各種 drafter 系列(如 DFlash、EAGLE-3 和 Multi-Token Prediction (MTP))的投機解碼 (speculative decoding)。
適用對象
使用 Mac 硬體並希望部署、測試或微調能夠處理文本、圖像、音訊與影片的多模態模型的開發人員與 AI 研究人員。
亮點
- 多模態支援:處理廣泛支援的模型(例如 Qwen、Gemma、MiniCPM)中的文本、圖像、音訊與影片輸入。
- 加速推理:支援投機解碼 (DFlash、EAGLE-3、MTP),可顯著提高 Token 吞吐量。
- 生產級伺服器:包含具有連續批處理 (continuous batching)、自動前綴快取與 KV 快取量化功能的 FastAPI 伺服器。
- 思考模式:支援「思考」模型(如 Qwen3.5),並為推理區塊提供可配置的 Token 預算。
- 本地優化:專為 MLX 設計,以最大化 Apple Silicon 的效能。