mlc-ai/mlc-llm
Universal LLM Deployment Engine with ML Compilation
What it solves
MLC LLM 提供了一種在廣泛的硬體平台與作業系統上原生部署大型語言模型 (LLMs) 的方法。它消除了運行 AI 模型時的硬體特定障礙,讓它們能夠在從高階 GPU 到手機與網頁瀏覽器的一切設備上高效運行。
How it works
該專案使用機器學習編譯器來轉換並優化 LLMs 以適應特定硬體。它在 MLCEngine 上運行這些模型,這是一個統一的高性能推理引擎。該引擎提供了一個與 OpenAI 相容的 API,使得透過 REST servers、Python、JavaScript、iOS 與 Android 進行整合非常容易。
Who it’s for
需要將 LLMs 部署在多種硬體(包括 AMD、NVIDIA、Apple 與 Intel GPU)以及不同平台(Linux、Windows、macOS、iOS、Android 與 Web Browsers)上的開發者。
Highlights
- Universal Deployment: 支持廣泛的 GPU (Vulkan, ROCm, CUDA, Metal, OpenCL) 與平台。
- ML Compilation: 使用編譯器來優化模型以獲得原生性能。
- OpenAI-compatible API: 透過標準 API 格式簡化整合。
- Broad Platform Support: 在桌面端、行動端與網頁瀏覽器(透過 WebGPU 與 WASM)上原生運行。