EricLBuehler/mistral.rs
Fast, flexible LLM inference
解决的问题
mistral.rs 是一个高性能 LLM 推理引擎,旨在实现本地或在生产环境中无需配置即可运行大型模型。它消除了手动设置、量化和硬件优化的摩擦,使用户只需一条命令即可运行任何 Hugging Face 模型。
工作原理
该引擎基于 Candle 框架构建,支持广泛的硬件加速器(CUDA, Metal, CPU)。它使用 continuous batching、PagedAttention 和 FlashAttention V2/V3 来最大化吞吐量。它提供了一个零配置 CLI,可自动检测模型架构、量化格式和聊天模板。对于服务,它提供了与 OpenAI 兼容和与 Anthropic 兼容的 API,并包含一个用于与模型交互的内置 Web UI。
适用对象
- 开发者:使用 Python 或 Rust SDK 构建 AI 应用的开发者。
- MLOps 工程师:使用 Prometheus 指标和 Docker 支持部署 LLM 的工程师。
- SRE:正在寻找具有多 GPU 和分布式推理能力的高吞吐量推理服务器的 SRE。
- AI 研究员:正在尝试多模态模型(文本、视觉、视频、音频)和各种量化方法的 AI 研究员。
亮点
- 零配置执行:通过
mistralrs run -m user/model立即运行任何 Hugging Face 模型。 - 真正的多模态:在一个引擎中集成支持文本、视觉、视频、音频和语音生成。
- 智能体运行时:内置对工具调用、本地 Python 代码执行、Shell 执行和网络搜索的支持。
- OpenAI & Anthropic 兼容性:作为这些 API 的即插即用替代方案,包括对 Anthropic Messages API 的支持。
- 智能量化:根据硬件自动选择最佳量化格式(例如 ISQ, GGUF, GPTQ, AWQ)。
- 分布式推理:使用 NCCL TP 支持多 GPU 和多节点分布式推理。
- 内置 Web UI:包含用于推理、代码执行和文件管理的原生界面。