superlinked/sie
Open-source inference server and production cluster for all the models your agent needs.
解决的问题
SIE (Superlinked Inference Engine) 消除了为每个不同的 AI 任务管理单独模型服务器的需要。它不再是碎片化的服务器拼凑,而是提供了一个单一的自托管集群,可以按需提供 100 多种不同的开源模型,涵盖从搜索和检索到文档转换和智能体循环(agentic loops)的所有内容。
工作原理
SIE 作为多种模型的统一 API 网关。它使用与 OpenAI 兼容的 API 以实现无缝迁移,并使用按需加载和 LRU (Least Recently Used) 驱逐机制来优化内存并管理模型。该系统专为生产环境设计,配备了负载均衡网关、KEDA 自动扩缩容(包括缩减至零)以及主要云提供商(GKE, EKS, AKS)的 Terraform 模块。
适用对象
构建 AI 智能体的开发人员,他们需要一种集中式、自托管的方式来运行多个专用模型(例如用于 embeddings、reranking、OCR 和 LLM 生成),而无需承担管理多个独立推理服务器的运维开销。
亮点
- 统一 API:支持
/v1/embeddings、/v1/chat/completions、/v1/completions和/v1/responses,便于集成。 - 广泛的任务支持:处理搜索(embedding/reranking)、文档转 Markdown 转换 (OCR)、结构化输出(实体提取)和内容安全。
- 生产级技术栈:包括 Grafana 仪表板、KEDA 自动扩缩容和特定云端的 Terraform 部署。
- 广泛的集成:可与 LangChain、LlamaIndex、Haystack、DSPy 和 CrewAI 等流行框架以及 Chroma 和 Qdrant 等向量数据库协同工作。