superlinked/sie

Open-source inference server and production cluster for all the models your agent needs.

解決的問題

SIE(Superlinked Inference Engine)消除了在 AI 代理工作流程中為每個獨立任務管理單獨模型伺服器的需要。無需為嵌入、OCR 和文字生成分別部署多個伺服器,它提供了一個單一的自托管叢集,可按需提供超過 100 個開源模型。

工作原理

SIE 作為統一的 API 網關,按需從 Hugging Face 加載模型,並使用最近最少使用(LRU)策略驅逐模型以管理記憶體。它提供 OpenAI 兼容 API,便於遷移,並透過專用 Docker 鏡像支援多種模態(例如 OCR 或 GPU 加速生成)。在生產環境中,它包含 Kubernetes 和 Helm 設定,支援負載平衡、KEDA 自動擴展以及透過 Grafana 進行監控。

適用對象

希望在自有雲中托管自己的開源模型,同時避免管理多個異構推理伺服器的運維負擔的開發者。

核心亮點

  • 統一模型目錄:支援多種任務,包括搜尋/檢索(BGE-M3、ColBERT)、文件轉 Markdown(Docling、PaddleOCR)、結構化輸出(GLiNER)和代理迴圈(Qwen)。
  • OpenAI 兼容:可直接取代標準 API 端點,如 /v1/chat/completions/v1/embeddings
  • 生產就緒基礎設施:附帶 Helm 圖表、KEDA 自動擴展(縮放至零)以及適用於主要雲端服務商(AWS、GCP、Azure、阿里雲)的 Terraform 模組。
  • 廣泛整合:與 LangChain、LlamaIndex、DSPy 等流行框架,以及 Chroma 和 Qdrant 等向量資料庫相容。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • Dispatch