IIIIIllllIIIIIlllll/llama.cpp-hub
An extension utility for llama.cpp, used with 3090*2 + Strix Halo. llama.cpp的拓展小工具,自用于3090*2 + Strix Halo。
解决的问题
llama.cpp-hub 是为 llama.cpp 设计的图形化 Web 界面,旨在简化 GGUF 模型的管理和操作。它无需直接处理复杂的命令行参数或远程服务器终端操作,提供一个集中式管理平台,用于管理多个模型和多个服务器。
工作原理
该项目作为 llama.cpp 子进程的封装器。它使用 Java 21 和 Netty 4.1 后端,为每个加载的模型管理独立的推理进程。它提供一个统一的 API 网关(端口 8080),将请求路由到各个模型进程,兼容 OpenAI 和 Anthropic API 格式。
适用人群
- 认为远程服务器终端操作繁琐的用户。
- 在网络中多台机器上运行 llama.cpp 的用户。
- 希望自行编译 llama.cpp 但又不想陷入管理混乱的用户。
- 难以记住 llama.cpp 大量配置参数的用户。
主要亮点
- 多模型管理:支持使用保存的启动配置和采样预设加载和卸载 GGUF 模型。
- 统一 API 网关:提供单一后端,暴露兼容 OpenAI 和 Anthropic 的 API,只需更改地址即可使用现有 SDK。
- 远程节点聚合:可将分布在不同服务器上的多个 llama.cpp-hub 实例聚合为单一管理入口点。
- Web 管理面板:提供实时状态、WebSocket 日志、令牌消耗统计和性能基准测试工具。
- PWA 支持:可作为渐进式 Web 应用安装,获得类原生桌面体验。
- 下载管理器:内置支持 HTTP 断点续传,用于传输 GGUF 模型。
- MCP 支持:内置 Model Context Protocol (MCP) 服务器,用于测试工具调用功能。
相关
- Dispatch
- 项目
- Dispatch
- 项目
- 项目