IIIIIllllIIIIIlllll/llama.cpp-hub
An extension utility for llama.cpp, used with 3090*2 + Strix Halo. llama.cpp的拓展小工具,自用于3090*2 + Strix Halo。
何を解決するか
llama.cpp-hub は、GGUF モデルの管理と操作を簡素化するために設計された、llama.cpp 用のグラフィカルな Web インターフェースです。複雑なコマンドライン引数やリモートサーバーのターミナル操作を必要とせず、複数のモデルや複数のサーバーを一元管理できるハブを提供します。
動作方法
このプロジェクトは、llama.cpp のサブプロセスをラップする役割を果たします。Java 21 と Netty 4.1 のバックエンドを使用して、各ロードされたモデルごとに独立した推論プロセスを管理します。ポート 8080 で統一された API ゲートウェイを公開し、リクエストをさまざまなモデルプロセスにルーティングすることで、OpenAI および Anthropic API 形式と互換性を持たせます。
対象ユーザー
- リモートサーバーのターミナル操作に煩わしさを感じるユーザー。
- ネットワーク上の複数のマシンで llama.cpp を実行しているユーザー。
- 自分で llama.cpp をコンパイルしたいが、管理の混乱を避けたいユーザー。
- llama.cpp の多数の設定パラメータを覚えきれないユーザー。
主な特徴
- マルチモデル管理:保存済みの起動設定とサンプリングプリセットで GGUF モデルのロード・アンロードが可能。
- 統一 API ゲートウェイ:OpenAI および Anthropic 互換の API を単一バックエンドで公開し、既存の SDK をアドレス変更だけで利用可能。
- リモートノード集約:複数のサーバーに分散した llama.cpp-hub インスタンスを、単一の管理エントリポイントに集約可能。
- Web 管理パネル:リアルタイムのステータス、WebSocket ログ、トークン消費統計、パフォーマンスベンチマークツールを提供。
- PWA 対応:プログレッシブ Web アプリとしてインストール可能で、ネイティブアプリに近いデスクトップ体験を提供。
- ダウンロードマネージャー:HTTP ブレイクポイント再開を内蔵し、GGUF モデルの転送をサポート。
- MCP 対応:ツールコール機能のテスト用に、内蔵された Model Context Protocol (MCP) サーバーを提供。
関連
- Dispatch
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト