superlinked/sie

Open-source inference server and production cluster for all the models your agent needs.

解决的问题

SIE(Superlinked Inference Engine)消除了在 AI 代理工作流中为每个独立任务管理单独模型服务器的需要。无需为嵌入、OCR 和文本生成分别部署多个服务器,它提供了一个单一的自托管集群,可按需提供超过 100 个开源模型。

工作原理

SIE 作为统一的 API 网关,按需从 Hugging Face 加载模型,并使用最近最少使用(LRU)策略驱逐模型以管理内存。它提供 OpenAI 兼容 API,便于迁移,并通过专用 Docker 镜像支持多种模态(例如 OCR 或 GPU 加速生成)。在生产环境中,它包含 Kubernetes 和 Helm 配置,支持负载均衡、KEDA 自动伸缩以及通过 Grafana 进行监控。

适用人群

希望在自有云中托管自己的开源模型,同时避免管理多个异构推理服务器的运维负担的开发者。

核心亮点

  • 统一模型目录:支持多种任务,包括搜索/检索(BGE-M3、ColBERT)、文档转 Markdown(Docling、PaddleOCR)、结构化输出(GLiNER)和代理循环(Qwen)。
  • OpenAI 兼容:可直接替换标准 API 端点,如 /v1/chat/completions/v1/embeddings
  • 生产就绪基础设施:附带 Helm 图表、KEDA 自动伸缩(缩放至零)以及适用于主要云服务商(AWS、GCP、Azure、阿里云)的 Terraform 模块。
  • 广泛集成:与 LangChain、LlamaIndex、DSPy 等流行框架,以及 Chroma 和 Qdrant 等向量数据库兼容。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • Dispatch