EricLBuehler/mistral.rs

Fast, flexible LLM inference

解決的問題

mistral.rs 是一個高性能 LLM 推理引擎,旨在實現本地或在生產環境中無需配置即可執行大型模型。它消除了手動設定、量化和硬體優化的摩擦,使用戶只需一條指令即可執行任何 Hugging Face 模型。

工作原理

該引擎基於 Candle 框架構建,支援廣泛的硬體加速器(CUDA, Metal, CPU)。它使用 continuous batching、PagedAttention 和 FlashAttention V2/V3 來最大化吞吐量。它提供了一個零配置 CLI,可自動偵測模型架構、量化格式和對話範本。對於服務,它提供了與 OpenAI 相容及與 Anthropic 相容的 API,並包含一個用於與模型互動的內建 Web UI。

適用對象

  • 開發者:使用 Python 或 Rust SDK 構建 AI 應用程式的開發者。
  • MLOps 工程師:使用 Prometheus 指標與 Docker 支援部署 LLM 的工程師。
  • SRE:正在尋找具備多 GPU 與分散式推理能力的具高吞吐量推理伺服器的 SRE。
  • AI 研究員:正在嘗試多模態模型(文本、視覺、影片、音訊)與各種量化方法的 AI 研究員。

亮點

  • 零配置執行:透過 mistralrs run -m user/model 立即執行任何 Hugging Face 模型。
  • 真正的多模態:在單一引擎中整合支援文本、視覺、影片、音訊與語音生成。
  • 代理執行階段 (Agentic Runtime):內建對工具呼叫、本地 Python 程式碼執行、Shell 執行與網路搜尋的支援。
  • OpenAI & Anthropic 相容性:作為這些 API 的即插即用替代方案,包括對 Anthropic Messages API 的支援。
  • 智慧量化:根據硬體自動選擇最佳量化格式(例如 ISQ, GFUF, GPTQ, AWQ)。
  • 分散式推理:使用 NCCL TP 支援多 GPU 與多節點分散式推理。
  • 內建 Web UI:包含用於推理、程式碼執行與檔案管理的原生介面。