messkan/prompt-cache

Cut LLM costs by up to 80% and unlock sub-millisecond responses with intelligent semantic caching.A drop-in, provider-agnostic LLM proxy written in Go with sub-millisecond response

What it solves

PromptCache は、冗長なアップストリーム API コールを回避することで、LLM アプリケーションのコストとレイテンシを削減します。RAG アプリケーション、AI agents、サポートボットなどのワークロードにおいて、似たような質問が同じ回答を得る傾向がある、繰り返し、またはそれに近い繰り返しのご要望に対応します。

How it works

アプリケーションと LLM プロバイダーの間のセルフホスト型プロキシとして機能します。2 つの閾値を用いたセマンティックマッチング戦略を使用し、新しいプロンプトがキャッシュされたレスポンスと十分に類似しているかを判断します:

  1. High similarity: 直接キャッシュヒットとなります。

  2. Low similarity: キャッシュミスとなります。

  3. Gray zone: オプションで、キャッシュされたレスポンスを返す前に、より小さなモデルを使用してプロンプトの意図を検証します。

OpenAI-compatible なので、既存の SDKs を使用して、ベース URL を変更するだけで、簡単に利用できます。BadgerDB を使用してデータを永続化し、SSE によるストリーミングレスポンスをサポートします。

Who it’s for

プロバイダーのコストを削減し、レスポンスタイムを短縮し、レート制限 (rate-limit) の余裕を増やしたい、プロダクション環境の GenAI ワークロードを構築している開発者向けです。

Highlights

  • OpenAI-compatible API: 既存の OpenAI-compatible クライアントとシームレスに統合できます。

  • Semantic Matching: 完全な文字列一致ではなく、embeddings を使用して類似のプロンプトを見つけます。

  • Multi-parameter support: OpenAI, Mistral AI, Anthropic/Claude (via Voyage AI) と連携して動作します。

  • Runtime Configuration: サービスを再起動せずに、類似度閾値やプロバイダーを更新できます。

  • Cache Warming: 既知のプロンプト-レスポンスのペアをキャッシュに事前填充 (pre-populating) をサポートします。 n

  • Observabilityability: Prometheus metrics と構造化されたログ (structured logging) を含みます。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト