algorithmicsuperintelligence/optillm
Optimizing inference proxy for LLMs
What it solves
OptiLLM은 더 작고 빠른 LLM과 최첨단 모델 사이의 복잡한 추론 작업에서 발생하는 성능 격차를 해소합니다. 사용자는 수학, 코딩, 논리 추론에서 비용이 많이 드는 모델 학습이나 파인튜닝 없이도 2~10배의 정확도 향상을 달성할 수 있습니다.
How it works
OptiLLM은 OpenAI API와 호환되는 추론 프록시 역할을 합니다. LLM에 직접 요청을 보내는 대신 OptiLLM을 통해 라우팅하면, 20가지가 넘는 최신 추론 시 최적화 기법을 적용합니다. 여기에는 멀티 에이전트 추론, 몬테카를로 트리 탐색(MCTS), 에이전트 혼합(MoA) 등이 포함되며, 추론 시 추가 연산을 사용해 응답을 정제하고 검증합니다.
Who it’s for
기존 LLM 배포(OpenAI, Anthropic, Google, Cerebras 등)를 변경하지 않고도 추론 능력을 강화하고자 하는 개발자와 연구자를 위해 설계되었습니다.
Highlights
- Zero Training: 파인튜닝 없이 즉시 정확도 향상.
- Drop-in Replacement: 모든 OpenAI 호환 API 엔드포인트에 투명하게 적용되는 프록시.
- Extensive Library: MARS, CePO, PlanSearch 등 20개 이상의 기술 구현.
- Plugin Ecosystem: 메모리, 프라이버시(PII 익명화), 웹 검색, 코드 실행 플러그인 포함.
- Multi-Provider Support: LiteLLM 통합을 통해 100개 이상의 모델 지원.