Blaizzy/mlx-vlm
MLX-VLM is a package for inference and fine-tuning of Vision Language Models (VLMs) on your Mac using MLX.
解決する課題
MLX-VLMは、MLXフレームワークを使用してApple Silicon Macに特別に最適化された、Vision Language Models (VLMs) および Omni Models (オーディオとビデオをサポート) を実行およびファインチューニングするための合理化された方法を提供します。これにより、これらの複雑なマルチモーダルモデルをローカルで高性能にデプロイするプロセスが簡素化されます。
仕組み
このパッケージはMLXフレームワークを活用して、効率的な推論とファインチューニングを可能にします。コマンドラインインターフェース (CLI)、Python API、GradioベースのチャットUI、およびFastAPIサーバーを含む、さまざまなインタラクションインターフェースを提供します。生成速度を向上させるために、DFlash、EAGLE-3、Multi-Token Prediction (MTP) などのさまざまなドラフターファミリーを使用した投機的デコーディングを実装しています。
対象者
テキスト、画像、オーディオ、ビデオを処理できるマルチモーダルモデルをデプロイ、テスト、またはファインチューニングしたい、Macハードウェアを使用する開発者およびAI研究者。
ハイライト
- マルチモーダルサポート: 幅広いサポートモデル (例: Qwen, Gemma, MiniCPM) にわたって、テキスト、画像、オーディオ、ビデオの入力を処理します。
- 推論の高速化: 投機的デコーディング (DFlash, EAGLE-3, MTP) をサポートし、トークンスループットを大幅に向上させます。
- プロダクション対応サーバー: 継続的バッチ処理、自動プレフィックスキャッシュ、およびKVキャッシュ量子化を備えたFastAPIサーバーが含まれています。
- 思考モード: 推論ブロックのトークン予算を構成可能な「思考」モデル (Qwen3.5など) をサポートしています。
- ローカル最適化: Apple Siliconのパフォーマンスを最大限に引き出すために、MLX向けに特別に設計されています。