algorithmicsuperintelligence/optillm

Optimizing inference proxy for LLMs

What it solves

OptiLLM は、より小さく高速な LLM と最先端モデルとの間にある複雑な推論タスクでの性能ギャップを埋めます。ユーザーは、数学、コーディング、論理推論において、費用のかかるモデル学習やファインチューニングなしで 2〜10 倍の精度向上を実現できます。

How it works

OptiLLM は OpenAI API 互換の推論プロキシとして機能します。LLM へ直接リクエストを送る代わりに、OptiLLM を経由させます。OptiLLM は 20 以上の最先端推論時最適化手法を適用します。これらの手法には、マルチエージェント推論、モンテカルロ木探索(MCTS)、エージェント混合(MoA)などが含まれ、推論時に追加計算を用いて応答を洗練・検証します。

Who it’s for

既存の LLM デプロイメント(OpenAI、Anthropic、Google、Cerebras など)を変更せずに推論能力を強化したい開発者や研究者向けに設計されています。

Highlights

  • Zero Training: ファインチューニング不要で即座に精度向上。
  • Drop-in Replacement: 任意の OpenAI 互換 API エンドポイントの透過的なプロキシとして機能。
  • Extensive Library: MARS、CePO、PlanSearch など、20 以上の手法を実装。
  • Plugin Ecosystem: メモリ、プライバシー(PII 匿名化)、ウェブ検索、コード実行用プラグインを含む。
  • Multi-Provider Support: LiteLLM 統合により 100 以上のモデルに対応。