Lightning-AI/LitServe

A minimal Python framework for building custom AI inference servers with full control over logic, batching, and scaling.

何を解決するか

LitServeは、単一のモデルタイプ向けに構築され、厳格な抽象化を強制する既存のサービングツールの硬直性を解決します。複雑なMLOpsのグルーコードや設定ファイルを用意することなく、純粋なPythonでカスタム推論サーバーを構築できるため、非標準的なパイプライン、マルチモデルシステム、およびAIエージェントのデプロイが容易になります。

仕組み

開発者は ls.LitAPI を継承して推論エンジンを定義します。setup() メソッドでモデルのロード方法を指定し、predict() メソッドでリクエストの処理方法を指定します。このロジックは ls.LitServer にラップされ、基盤となるパフォーマンス、並行性、スケーリング、およびデプロイを管理します。FastAPIに基づいて構築されていますが、AIワークロード向けに特別に最適化されており、より優れたマルチワーカー処理を提供します。

対象者

チャットボット、RAGシステム、MCPサーバー、または複雑なマルチモデルパイプラインを構築しているかどうかに関わらず、推論ロジック、バッチ処理、ルーティング、およびオーケストレーションを完全に制御する必要があるAI開発者向けに設計されています。

ハイライト

  • 柔軟なデプロイ: あらゆるPyTorch、JAX、またはTensorFlowモデルをサポートし、セルフホストまたはLightning AI経由でデプロイ可能です。
  • AIに最適化されたパフォーマンス: AIタスクにおいて、プレーンなFastAPIよりも2倍高速であると主張しています。
  • 高度なサービング機能: バッチ処理、ストリーミング、およびGPUオートスケーリングの組み込みサポートが含まれています。
  • C-Suite互換性: OpenAPIに準拠し、OpenAIの仕様をサポートしています。
  • 幅広いユースケースのサポート: LLMやマルチモーダルモデルから、XGBoostのような古典的なMLモデルまで、あらゆるものをサービング可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト