EricLBuehler/mistral.rs
Fast, flexible LLM inference
解決する課題
mistral.rs は、大規模モデルをローカルまたは本番環境で設定なしで実行できるように設計された高性能LLM推論エンジンです。手動でのセットアップ、量子化、ハードウェア最適化の手間を排除し、ユーザーが単一のコマンドで任意の Hugging Face モデルを実行できるようにします。
仕組み
このエンジンは Candle フレームワークに基づいて構築されており、幅広いハードウェアアクセラレータ(CUDA, Metal, CPU)をサポートしています。Continuous batching、PagedAttention、および FlashAttention V2/V3 を使用してスループットを最大化します。モデルアーキテクチャ、量子化形式、チャットテンプレートを自動検出するゼロ設定 CLI を提供します。サービングに関しては、OpenAI 互換および Anthropic 互換の API を公開し、モデルと対話するための組み込み Web UI を備えています。
対象ユーザー
- 開発者: Python または Rust SDK を使用して AI アプリケーションを構築している方。
- MLOps エンジニア: Prometheus メトリクスと Docker サポートを備えた LLM のデプロイを行う方。
- SRE: マルチ GPU および分散推論機能を備えた高スループットの推論サーバーを探している方。
- AI 研究者: マルチモーダルモデル(テキスト、ビジョン、ビデオ、オーディオ)や様々な量子化手法を実験している方。
ハイライト
- ゼロ設定実行:
mistralrs run -m user/modelを介して、任意の Hugging Face モデルを即座に実行。 - 真のマルチモーダル性: テキスト、ビジョン、ビデオ、オーディオ、音声生成を一つのエンジンで統合サポート。
- エージェント・ランタイム: ツール呼び出し、ローカル Python コードの実行、シェル実行、ウェブ検索を組み込みサポート。
- OpenAI & Anthropic 互換性: これらの API のドロップイン・リプレイスメントとして機能し、Anthropic Messages API もサポート。
- スマート量子化: ハードウェアに基づいて最適な量子化形式(例:ISQ, GGUF, GPTQ, AWQ)を自動選択。
- 分散推論: NCCL TP を使用したマルチ GPU およびマルチノード分散推論をサポート。
- 組み込み Web UI: 推論、コード実行、ファイル管理のためのネイティブインターフェースを搭載。