llmmanorg/llmman

Run any agent on any model, models stored as OCI images

解決的問題

llmman 是一個統一的介面,用於執行 AI 代理和模型,消除了管理不同推論伺服器、模型格式和提供者所帶來的繁瑣。使用者可以使用單一指令,將代理(例如 Claude Code 或 Aider)執行在任何模型上,無論該模型是本地託管於使用者的機器上,還是透過託管提供者提供。

工作原理

llmman 作為一個管理層,負責處理模型拉取、服務與路由。它使用標準的 OCI(開放容器倡議)工件來打包和儲存模型,允許從 Docker Hub、GHCR 或 Hugging Face 拉取模型。對於本地推論,它直接利用上游引擎如 llama.cppvLLMSGLangmlx-lm,無需修改模型檔案。它提供一個與 Ollama、OpenAI 和 Anthropic API 相容的單一 API 端點,然後將請求路由至適當的本地後端或託管提供者。

適用對象

希望在不同硬體(本地或雲端)上執行各種代理和模型,而不被鎖定於特定提供者或註冊表的開發者與 AI 研究人員;以及在空氣隔離或合規性受限環境中,需要安全、已簽署模型傳輸的使用者。

主要亮點

  • 提供者與註冊表無關性: 可直接從 Hugging Face 或任何 OCI 註冊表拉取模型,並透過單一端點將請求路由至本地或託管提供者。
  • 一步傳輸: 可直接在註冊表之間傳輸模型(例如從 Hugging Face 到私人 OCI 註冊表),無需在本機儲存。
  • 硬體池化(聚合): 將多台執行 llmman serve 的機器合併為一個邏輯端點,以在網絡中分散模型負載。
  • 統一 API: 一個伺服器同時支援 Ollama、OpenAI 和 Anthropic API。
  • 跨模型混合配對: 當本地模型的上下文視窗超出時,自動將請求路由至託管提供者。
  • 安全模型驗證: 支援 cosign 格式簽名,以驗證從註冊表拉取的模型的真實性。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案