superlinked/sie

Open-source inference server and production cluster for all the models your agent needs.

해결하는 문제

SIE(Superlinked Inference Engine)는 AI 에이전트 워크플로우에서 각각의 작업에 대해 별도의 모델 서버를 관리할 필요를 제거합니다. 임베딩, OCR, 텍스트 생성을 위한 별도의 서버들을 조합하는 대신, 필요 시 100개 이상의 오픈소스 모델을 제공하는 단일 자기 호스팅 클러스터를 제공합니다.

작동 방식

SIE는 필요에 따라 Hugging Face에서 모델을 로드하고, 메모리 관리를 위해 최소 최근 사용(LRU) 전략으로 모델을 제거하는 통합 API 게이트웨이 역할을 합니다. 이는 쉽게 마이그레이션할 수 있도록 OpenAI 호환 API를 제공하며, OCR 또는 GPU 가속 생성과 같은 전용 Docker 이미지를 통해 다양한 모달리티를 지원합니다. 프로덕션 환경에서는 로드 밸런싱, KEDA 오토스케일링, Grafana를 통한 모니터링을 위한 Kubernetes 및 Helm 구성이 포함되어 있습니다.

대상 사용자

자사 클라우드에서 오픈소스 모델을 자체 호스팅하고 싶지만, 여러 개의 별도 추론 서버를 관리하는 운영 부담을 피하고 싶은 개발자들.

주요 특징

  • 통합 모델 카탈로그: 검색/리트리ieval(BGE-M3, ColBERT), 문서 → 마크다운(Docling, PaddleOCR), 구조화 출력(GLiNER), 에이전트 루프(Qwen) 등 다양한 작업을 지원합니다.
  • OpenAI 호환: /v1/chat/completions/v1/embeddings와 같은 표준 API 엔드포인트에 즉시 대체 가능합니다.
  • 프로덕션 준비 인프라: Helm 차트, KEDA 오토스케일링(스케일 투 제로), 주요 클라우드 제공업체(AWS, GCP, Azure, Alibaba)용 Terraform 모듈이 함께 제공됩니다.
  • 광범위한 통합: LangChain, LlamaIndex, DSPy와 같은 인기 프레임워크, Chroma 및 Qdrant와 같은 벡터 데이터베이스와 호환됩니다.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch