guoqingbao/xinfer

Blazing-fast LLM inference in pure Rust. No PyTorch and Python runtime.

何を解決するか

xInferは、PythonおよびPyTorchのオーバーヘッドを排除する高パフォーマンスなLLM推論エンジンです。最小限のメモリ使用量と高いスループットで、大規模なモデルを実行するためのポータブルでプロダクション対応の環境を提供し、特にコンシューマー向けGPU上で大規模なMoE(エキスパートの混合)モデルを実行することを目的としています。

動作方法

Rustで完全に構築されたxInferは、Pythonランタイムをバイパスするネイティブバックエンドを実装しています。ネイティブFlash Attention、FlashInfer、CUDA Graphs、連続バッチ処理などの高度な最適化技術を活用しています。メモリ制約に対処するため、「TurboQuant」(2–4ビットのKVキャッシュ圧縮)を使用し、NVFP4、FP8、GGUFなどのさまざまな量子化形式をサポートしています。また、Prefill-Decode Disaggregationをサポートしており、プロンプト処理(prefill)とトークン生成(decode)を異なるGPUやマシンに分割することで、スタールを防ぎます。

対象ユーザー

高速で軽量、クロスプラットフォーム(Linux、Windows、macOS)対応の推論サーバーが必要な開発者や運用担当者向けです。OpenAIおよびAnthropic APIと互換性があり、限られたハードウェア上で大規模モデルをデプロイしたいユーザーにも適しています。

主な特徴

  • Python依存なし:パフォーマンスとポータビリティを向上させる純粋なRustバックエンド。
  • 積極的なKV圧縮:TurboQuantによりコンテキスト長が最大4.3倍に拡張され、30B以上のモデルを単一の24/32GB GPUで実行可能になります。
  • 広範なモデル対応:Llama、Qwen、Mistral、GLM、DeepSeek、Phi、Gemmaを含む、マルチモーダル版も含む。
  • プロダクション対応機能:ChatGPT風のWeb UI、MCPツールコール、ガイド付きデコードによる構造化出力を内蔵。
  • マルチノードスケーリング:MPIを必要とせず、TCPベースのNCCLブートストラップを使用して複数マシン間でのテンソル並列をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト