Blaizzy/mlx-vlm
MLX-VLM is a package for inference and fine-tuning of Vision Language Models (VLMs) on your Mac using MLX.
해결하는 문제
MLX-VLM은 MLX 프레임워크를 사용하여 Apple Silicon Mac에 특별히 최적화된 Vision Language Models (VLMs) 및 Omni Models (오디오 및 비디오 지원)를 실행하고 미세 조정할 수 있는 간소화된 방법을 제공합니다. 이를 통해 이러한 복잡한 멀티모달 모델을 로컬에서 고성능으로 배포하는 프로세스를 단순화합니다.
작동 방식
이 패키지는 MLX 프레임워크를 활용하여 효율적인 추론 및 미세 조정을 가능하게 합니다. 명령줄 인터페이스 (CLI), Python API, Gradio 기반 채팅 UI 및 FastAPI 서버를 포함한 다양한 상호작용 인터페이스를 제공합니다. 생성 속도를 높이기 위해 DFlash, EAGLE-3 및 Multi-Token Prediction (MTP)와 같은 다양한 drafter 제품군을 사용하는投機的 decoding(speculative decoding)을 구현합니다.
대상 사용자
텍스트, 이미지, 오디오 및 비디오를 처리할 수 있는 멀티모달 모델을 배포, 테스트 또는 미세 조정하려는 Mac 하드웨어 사용자(개발자 및 AI 연구자).
주요 특징
- 멀티모달 지원: 광범위한 지원 모델(예: Qwen, Gemma, MiniCPM)에 대해 텍스트, 이미지, 오디오 및 비디오 입력을 처리합니다.
- 추론 속도 향상: 투기적 디코딩(DFlash, EAGLE-3, MTP)을 지원하여 토큰 처리량을 크게 증가시킵니다.
- 프로덕션용 서버: 연속 배칭(continuous batching), 자동 접두사 캐싱(automatic prefix caching) 및 KV 캐시 양자화 기능이 포함된 FastAPI 서버를 포함합니다.
- 사고 모드(Thinking Mode): 추론 블록을 위한 구성 가능한 토큰 예산이 있는 "사고" 모델(Qwen3.5와 같은)을 지원합니다。
- 로컬 최적화: Apple Silicon의 성능을 극대화하기 위해 MLX에 맞게 특별히 설계되었습니다.