superlinked/sie
Open-source inference server and production cluster for all the models your agent needs.
해결하는 문제
SIE (Superlinked Inference Engine)는 모든 서로 다른 AI 작업을 위해 개별 모델 서버를 관리해야 하는 번거로움을 제거합니다. 파편화된 서버 구성 대신, 검색 및 검색(retrieval)부터 문서 변환 및 에이전트 루프에 이르기까지 100개 이상의 다양한 오픈 소스 모델을 온디맨드로 제공할 수 있는 단일 셀프 호스팅 클러스터를 제공합니다.
작동 방식
SIE는 다양한 모델을 위한 통합 API 게이트웨이 역할을 합니다. OpenAI 호환 API를 사용하여 즉시 전환이 가능하며, 메모리 최적화를 위해 온디맨드 로딩 및 LRU (Least Recently Used) 제거 방식을 사용하여 모델을 관리합니다. 이 시스템은 프로덕션 환경에 적합하도록 설계되었으며, 로드 밸런싱 게이트웨이, KEDA 오토스케일링(scale-to-zero 포함) 및 주요 클라우드 제공업체(GKE, EKS, AKS)를 위한 Terraform 모듈을 제공합니다.
대상 사용자
여러 독립적인 추론 서버를 관리하는 운영 부담 없이, 여러 특화된 모델(예: embeddings, reranking, OCR 및 LLM 생성용)을 실행하기 위한 중앙 집중식 셀프 호스팅 방식이 필요한 AI 에이전트 구축 개발자.
주요 특징
- 통합 API:
/v1/embeddings,/v1/chat/completions,/v1/completions및/v1/responses를 지원하여 쉬운 통합이 가능합니다. - 폭넓은 작업 지원: 검색(embedding/reranking), 문서-to-markdown 변환(OCR), 구조화된 출력(entity extraction) 및 콘텐츠 안전성을 처리합니다.
- 프로덕션 스택: Grafana 대시보드, KEDA 오토스케일링 및 클라우드별 Terraform 배포를 포함합니다.
- 광범위한 통합: LangChain, LlamaIndex, Haystack, DSPy, CrewAI와 같은 인기 프레임워크는 물론 Chroma 및 Qdrant와 같은 벡터 데이터베이스와 함께 작동합니다.