llmmanorg/llmman
Run any agent on any model, models stored as OCI images
解决的问题
llmman 是一个统一的接口,用于运行 AI 代理和模型,消除了管理不同推理服务器、模型格式和提供商的繁琐操作。用户可以使用单个命令,将代理(如 Claude Code 或 Aider)运行在任何模型上,无论该模型是本地托管在用户机器上,还是通过托管提供商提供。
工作原理
llmman 作为一个管理层,负责处理模型拉取、服务和路由。它使用标准的 OCI(开放容器倡议)工件来打包和存储模型,允许从 Docker Hub、GHCR 或 Hugging Face 拉取模型。对于本地推理,它直接利用上游引擎如 llama.cpp、vLLM、SGLang 和 mlx-lm,无需修改模型文件。它提供一个与 Ollama、OpenAI 和 Anthropic API 兼容的单一 API 端点,然后将请求路由到适当的本地后端或托管提供商。
适用人群
希望在不同硬件(本地或云)上运行各种代理和模型,而不被锁定在特定提供商或注册表的开发者和 AI 研究人员;以及在空气隔离或合规性受限环境中,需要安全、已签名模型传输的用户。
主要亮点
- 提供商和注册表无关性: 可直接从 Hugging Face 或任何 OCI 注册表拉取模型,并通过单一端点将请求路由到本地或托管提供商。
- 一步传输: 可直接在注册表之间传输模型(例如从 Hugging Face 到私有 OCI 注册表),无需在本地存储。
- 硬件池化(聚合): 将多台运行
llmman serve的机器合并为一个逻辑端点,以在网络中分发模型负载。 - 统一 API: 一个服务器同时支持 Ollama、OpenAI 和 Anthropic API。
- 跨模型混合配对: 当本地模型的上下文窗口超出时,自动将请求路由到托管提供商。
- 安全模型验证: 支持 cosign 格式签名,以验证从注册表拉取的模型的真实性。
相关
- 项目
- 项目
- 项目
- 项目
- 项目