cubist38/mlx-openai-server
A high-performance API server that provides OpenAI-compatible endpoints for MLX models. Developed using Python and powered by the FastAPI framework, it provides an efficient, scalable, and user-friendly solution for running MLX-based vision and language models locally with an OpenAI-compatible interface.
解決的問題
提供一個 OpenAI 相容的 API 伺服器,用於在 Apple Silicon 上使用 MLX 框架執行各種本地 AI 模型。這讓使用者能使用熟悉的 OpenAI SDK 和客戶端與在 Mac 上本地執行的模型互動,無需依賴外部 API。
工作原理
伺服器扮演 OpenAI 風格 API 請求與多個 MLX 後端之間的橋樑。支援多種模型類型,包括文字(lm)、多模態(vlm)、影像生成與編輯(mflux)、嵌入(embeddings)以及語音轉錄(whisper)。可透過命令列啟動單一模型,或使用 YAML 設定檔同時啟動多個模型,每個模型在獨立的子流程中執行,以隔離 Metal 執行時狀態。
適用對象
在 Apple Silicon 上使用 macOS 的開發者與 AI 研究人員,希望使用標準化 API 介面將本地模型部署至現有應用程式或代理中。
主要亮點
- 廣泛的模型支援:支援文字、視覺-語言模型、影像生成/編輯、嵌入與 Whisper 轉錄。
- OpenAI 相容性:實作標準端點,如
/v1/chat/completions、/v1/images/generations與/v1/embeddings。 - 效能調校:提供連續批次、推測解碼與 KV 快取量化等選項,以優化記憶體與吞吐量。
- 記憶體管理:提供詳細指引與設定選項,防止 macOS 上出現 Metal 記憶體不足(OOM)錯誤。
- 多模型主機:支援透過 YAML 設定檔載入多個模型,包含節省記憶體的「按需載入」功能。
相關
- 專案
- 專案
- 專案
- 專案
- 專案