lablup/mlxcel
High-performance LLM/VLM inference runtime and server for Apple Silicon / NVIDIA CUDA devices
解決的問題
mlxcel 是一個高效率的推論執行環境與伺服器,專為消除部署大型語言模型(LLMs)與視覺語言模型(VLMs)時對 Python 環境的需求而設計。它提供原生、單一程序執行環境,簡化部署、打包與服務監控,同時維持與 Python 基礎的 MLX 參考實作相當的效能。
工作原理
以 Rust 實作的 mlxcel 使用原生 MLX C++ 繫結來執行模型。支援 Apple Silicon、NVIDIA CUDA 相容裝置,以及實驗性的 OpenXLA 相容裝置。執行時在單一原生程序內處理模型載入、排程與推論,可直接從 mlx-community 檢查點執行模型,無需轉換步驟。
適用對象
適合希望以最小開銷部署本地或小型叢集推論伺服器的開發者與運維人員,從 llama.cpp 迁移的使用者(因其具有 OpenAI 相容 API 與類似的旗標結構),以及使用 Apple Silicon 或 NVIDIA GPU 的使用者。
主要特色
- 原生效能:達成與
mlx-lm和mlx-vlm相近的解碼吞吐量,短提示文字預填入速度顯著更快。 - 廣泛模型支援:支援包括 Llama、Qwen、Gemma、Phi、Mistral、DeepSeek 等多種文字與視覺語言模型家族。
- OpenAI 相容:提供
/v1/chat/completions、/v1/completions與/v1/responses的 OpenAI 相容 HTTP API。 - 生產就緒功能:包含連續批次處理、提示前綴快取、推測解碼與 KV 快取壓縮。
- 模型手術:支援在載入時透過 YAML 進行第一級的模型手術(縮放、新增、剪枝、取代、插值),無需重新訓練即可變更權重空間。
- 分散式推論:為特定模型家族實作張量與流水線平行處理。
相關
- 專案
- 專案
- 專案
- 專案
- 專案