IIIIIllllIIIIIlllll/llama.cpp-hub
An extension utility for llama.cpp, used with 3090*2 + Strix Halo. llama.cpp的拓展小工具,自用于3090*2 + Strix Halo。
解決的問題
llama.cpp-hub 是為 llama.cpp 設計的圖形化 Web 界面,旨在簡化 GGUF 模型的管理和操作。它無需直接處理複雜的命令列參數或遠端伺服器終端操作,提供一個集中式管理平台,用於管理多個模型和多個伺服器。
工作原理
此專案作為 llama.cpp 子行程的封裝器。它使用 Java 21 和 Netty 4.1 後端,為每個載入的模型管理獨立的推論行程。它提供一個統一的 API 網關(埠 8080),將請求路由到各個模型行程,相容 OpenAI 與 Anthropic API 格式。
適用對象
- 覺得遠端伺服器終端操作煩瑣的使用者。
- 在網路中多台機器上執行 llama.cpp 的使用者。
- 希望自行編譯 llama.cpp 但又不想陷入管理混亂的使用者。
- 難以記住 llama.cpp 大量設定參數的使用者。
主要亮點
- 多模型管理:支援使用儲存的啟動設定和取樣預設載入和卸載 GGUF 模型。
- 統一 API 網關:提供單一後端,暴露相容 OpenAI 與 Anthropic 的 API,只需更換位址即可使用現有 SDK。
- 遠端節點聚合:可將分散在不同伺服器上的多個 llama.cpp-hub 實例聚合為單一管理入口點。
- Web 管理面板:提供即時狀態、WebSocket 日誌、令牌消耗統計與效能基準測試工具。
- PWA 支援:可作為漸進式 Web 應用安裝,獲得類原生桌面體驗。
- 下載管理器:內建支援 HTTP 斷點續傳,用於傳輸 GGUF 模型。
- MCP 支援:內建 Model Context Protocol (MCP) 伺服器,用於測試工具呼叫功能。
相關
- Dispatch
- 專案
- Dispatch
- 專案
- 專案