superlinked/sie

Open-source inference server and production cluster for all the models your agent needs.

解決的問題

SIE (Superlinked Inference Engine) 消除了為每個不同的 AI 任務管理單獨模型伺服器的需要。它不再是碎片化的伺服器拼湊,而是提供了一個單一的自託管集群,可以按需提供 100 多種不同的開源模型,涵蓋從搜尋和檢索到文件轉換和代理循環(agentic loops)的所有內容。

工作原理

SIE 作為多種模型的統一 API 閘道。它使用與 OpenAI 相容的 API 以實現無縫遷移,並使用按需載入和 LRU (Least Recently Used) 驅逐機制來優化記憶體並管理模型。該系統專為生產環境設計,配備了負載平衡閘道、KEDA 自動擴縮容(包括縮減至零)以及主要雲端提供商(GKE, EKS, AKS)的 Terraform 模組。

適用對象

構建 AI 代理的開發人員,他們需要一種集中式、自託管的方式來執行多個專用模型(例如用於 embeddings、reranking、OCR 和 LLM 生成),而無需承擔管理多個獨立推理伺服器的維運開銷。

亮點

  • 統一 API:支援 /v1/embeddings/v1/chat/completions/v1/completions/v1/responses,便於整合。
  • 廣泛的任務支援:處理搜尋(embedding/reranking)、文件轉 Markdown 轉換 (OCR)、結構化輸出(實體提取)和內容安全。
  • 生產級技術棧:包括 Grafana 儀表板、KEDA 自動擴縮容和特定雲端的 Terraform 部署。
  • 廣泛的整合:可與 LangChain、LlamaIndex、Haystack、DSPy 和 CrewAI 等流行框架以及 Chroma 和 Qdrant 等向量資料庫協同工作。