algorithmicsuperintelligence/optillm
Optimizing inference proxy for LLMs
What it solves
OptiLLM 解决了较小、较快的 LLM 与前沿模型在复杂推理任务上的性能差距。它让用户在数学、编码和逻辑推理上,无需昂贵的模型训练或微调,即可实现 2‑10 倍的显著准确率提升。
How it works
OptiLLM 充当一个兼容 OpenAI API 的推理代理。与其直接向 LLM 发送请求,不如将请求通过 OptiLLM 路由,OptiLLM 会应用超过 20 种最先进的推理时优化技术。这些技术包括多代理推理、蒙特卡罗树搜索(MCTS)以及代理混合(MoA),在推理时使用额外计算资源来细化和验证响应。
Who it’s for
它面向希望提升现有 LLM 部署(无论是 OpenAI、Anthropic、Google、Cerebras 等提供商)推理能力的开发者和研究人员,且无需更改底层模型。
Highlights
- Zero Training: 无需微调,即可立即提升准确度。
- Drop-in Replacement: 作为透明代理,可直接替代任何兼容 OpenAI 的 API 端点。
- Extensive Library: 实现 20 多种技术,包括 MARS、CePO、PlanSearch 等。
- Plugin Ecosystem: 包含记忆、隐私(PII 匿名化)、网络搜索和代码执行等插件。
- Multi-Provider Support: 通过 LiteLLM 集成,兼容 100 多种模型。