EricLBuehler/mistral.rs

Fast, flexible LLM inference

解决的问题

mistral.rs 是一个高性能 LLM 推理引擎,旨在实现本地或在生产环境中无需配置即可运行大型模型。它消除了手动设置、量化和硬件优化的摩擦,使用户只需一条命令即可运行任何 Hugging Face 模型。

工作原理

该引擎基于 Candle 框架构建,支持广泛的硬件加速器(CUDA, Metal, CPU)。它使用 continuous batching、PagedAttention 和 FlashAttention V2/V3 来最大化吞吐量。它提供了一个零配置 CLI,可自动检测模型架构、量化格式和聊天模板。对于服务,它提供了与 OpenAI 兼容和与 Anthropic 兼容的 API,并包含一个用于与模型交互的内置 Web UI。

适用对象

  • 开发者:使用 Python 或 Rust SDK 构建 AI 应用的开发者。
  • MLOps 工程师:使用 Prometheus 指标和 Docker 支持部署 LLM 的工程师。
  • SRE:正在寻找具有多 GPU 和分布式推理能力的高吞吐量推理服务器的 SRE。
  • AI 研究员:正在尝试多模态模型(文本、视觉、视频、音频)和各种量化方法的 AI 研究员。

亮点

  • 零配置执行:通过 mistralrs run -m user/model 立即运行任何 Hugging Face 模型。
  • 真正的多模态:在一个引擎中集成支持文本、视觉、视频、音频和语音生成。
  • 智能体运行时:内置对工具调用、本地 Python 代码执行、Shell 执行和网络搜索的支持。
  • OpenAI & Anthropic 兼容性:作为这些 API 的即插即用替代方案,包括对 Anthropic Messages API 的支持。
  • 智能量化:根据硬件自动选择最佳量化格式(例如 ISQ, GGUF, GPTQ, AWQ)。
  • 分布式推理:使用 NCCL TP 支持多 GPU 和多节点分布式推理。
  • 内置 Web UI:包含用于推理、代码执行和文件管理的原生界面。