IIIIIllllIIIIIlllll/llama.cpp-hub

An extension utility for llama.cpp, used with 3090*2 + Strix Halo. llama.cpp的拓展小工具,自用于3090*2 + Strix Halo。

何を解決するか

llama.cpp-hub は、GGUF モデルの管理と操作を簡素化するために設計された、llama.cpp 用のグラフィカルな Web インターフェースです。複雑なコマンドライン引数やリモートサーバーのターミナル操作を必要とせず、複数のモデルや複数のサーバーを一元管理できるハブを提供します。

動作方法

このプロジェクトは、llama.cpp のサブプロセスをラップする役割を果たします。Java 21 と Netty 4.1 のバックエンドを使用して、各ロードされたモデルごとに独立した推論プロセスを管理します。ポート 8080 で統一された API ゲートウェイを公開し、リクエストをさまざまなモデルプロセスにルーティングすることで、OpenAI および Anthropic API 形式と互換性を持たせます。

対象ユーザー

  • リモートサーバーのターミナル操作に煩わしさを感じるユーザー。
  • ネットワーク上の複数のマシンで llama.cpp を実行しているユーザー。
  • 自分で llama.cpp をコンパイルしたいが、管理の混乱を避けたいユーザー。
  • llama.cpp の多数の設定パラメータを覚えきれないユーザー。

主な特徴

  • マルチモデル管理:保存済みの起動設定とサンプリングプリセットで GGUF モデルのロード・アンロードが可能。
  • 統一 API ゲートウェイ:OpenAI および Anthropic 互換の API を単一バックエンドで公開し、既存の SDK をアドレス変更だけで利用可能。
  • リモートノード集約:複数のサーバーに分散した llama.cpp-hub インスタンスを、単一の管理エントリポイントに集約可能。
  • Web 管理パネル:リアルタイムのステータス、WebSocket ログ、トークン消費統計、パフォーマンスベンチマークツールを提供。
  • PWA 対応:プログレッシブ Web アプリとしてインストール可能で、ネイティブアプリに近いデスクトップ体験を提供。
  • ダウンロードマネージャー:HTTP ブレイクポイント再開を内蔵し、GGUF モデルの転送をサポート。
  • MCP 対応:ツールコール機能のテスト用に、内蔵された Model Context Protocol (MCP) サーバーを提供。

関連

  • Dispatch
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト