mlc-ai/mlc-llm
Universal LLM Deployment Engine with ML Compilation
What it solves
MLC LLM 提供了一种在广泛的硬件平台和操作系统上原生部署大型语言模型 (LLMs) 的方法。它消除了运行 AI 模型时的硬件特定障碍,使得它们能够高效地运行在从高端 GPU 到手机和网页浏览器上的一切设备上。
How it works
该项目使用机器学习编译器来转换并优化 LLMs 以适应特定硬件。它在 MLCEngine 上运行这些模型,这是一个统一的高性能推理引擎。该引擎提供了一个与 OpenAI 兼容的 API,使得通过 REST servers、Python、JavaScript、iOS 和 Android 进行集成非常容易。
Who it’s for
需要将 LLMs 部署在多种硬件(包括 AMD、NVIDIA、Apple 和 Intel GPUs)以及不同平台(Linux、Windows、macOS、iOS、Android 和 Web Browsers)上的开发者。
Highlights
- Universal Deployment: 支持广泛的 GPU (Vulkan, ROCm, CUDA, Metal, OpenCL) 和平台。
- ML Compilation: 使用编译器来优化模型以获得原生性能。
- OpenAI-compatible API: 通过标准 API 格式简化集成。
- nBroad Platform Support: 在桌面端、移动端和网页浏览器(通过 WebGPU 和 WASM)上原生运行。