algorithmicsuperintelligence/optillm

Optimizing inference proxy for LLMs

What it solves

OptiLLM 解决了较小、较快的 LLM 与前沿模型在复杂推理任务上的性能差距。它让用户在数学、编码和逻辑推理上,无需昂贵的模型训练或微调,即可实现 2‑10 倍的显著准确率提升。

How it works

OptiLLM 充当一个兼容 OpenAI API 的推理代理。与其直接向 LLM 发送请求,不如将请求通过 OptiLLM 路由,OptiLLM 会应用超过 20 种最先进的推理时优化技术。这些技术包括多代理推理、蒙特卡罗树搜索(MCTS)以及代理混合(MoA),在推理时使用额外计算资源来细化和验证响应。

Who it’s for

它面向希望提升现有 LLM 部署(无论是 OpenAI、Anthropic、Google、Cerebras 等提供商)推理能力的开发者和研究人员,且无需更改底层模型。

Highlights

  • Zero Training: 无需微调,即可立即提升准确度。
  • Drop-in Replacement: 作为透明代理,可直接替代任何兼容 OpenAI 的 API 端点。
  • Extensive Library: 实现 20 多种技术,包括 MARS、CePO、PlanSearch 等。
  • Plugin Ecosystem: 包含记忆、隐私(PII 匿名化)、网络搜索和代码执行等插件。
  • Multi-Provider Support: 通过 LiteLLM 集成,兼容 100 多种模型。