IIIIIllllIIIIIlllll/llama.cpp-hub
An extension utility for llama.cpp, used with 3090*2 + Strix Halo. llama.cpp的拓展小工具,自用于3090*2 + Strix Halo。
해결하는 문제
llama.cpp-hub는 GGUF 모델의 관리와 운영을 간소화하기 위해 설계된 llama.cpp용 그래픽 웹 인터페이스입니다. 복잡한 명령줄 인수나 원격 서버 터미널 작업을 직접 다룰 필요 없이, 여러 모델과 여러 서버를 중앙에서 관리할 수 있는 허브를 제공합니다.
작동 방식
이 프로젝트는 llama.cpp 하위 프로세스를 래핑하는 역할을 합니다. Java 21과 Netty 4.1 백엔드를 사용하여 각 로드된 모델에 대해 독립적인 추론 프로세스를 관리합니다. 포트 8080에서 통합 API 게이트웨이를 노출하여 요청을 다양한 모델 프로세스로 라우팅하며, OpenAI 및 Anthropic API 형식과 호환됩니다.
대상 사용자
- 원격 서버 터미널 작업이 번거로운 사용자.
- 네트워크를 통해 여러 머신에서 llama.cpp를 실행하는 사용자.
- 직접 llama.cpp를 컴파일하고 싶지만 조직적 혼란을 피하고 싶은 사용자.
- llama.cpp의 수많은 설정 파라미터를 기억하기 어려운 사용자.
주요 기능
- 다중 모델 관리: 저장된 시작 설정과 샘플링 프리셋을 사용해 GGUF 모델을 로드하고 언로드할 수 있습니다.
- 통합 API 게이트웨이: OpenAI 및 Anthropic 호환 API를 단일 백엔드에서 노출하여 기존 SDK를 단순한 주소 변경만으로 사용할 수 있습니다.
- 원격 노드 집약: 다양한 서버에 분산된 여러 llama.cpp-hub 인스턴스를 하나의 관리 엔트리 포인트로 통합할 수 있습니다.
- 웹 관리 패널: 실시간 상태, WebSocket 로그, 토큰 소비 통계, 성능 벤치마킹 도구를 제공합니다.
- PWA 지원: 프로그레시브 웹 앱으로 설치 가능하여 네이티브 앱에 가까운 데스크톱 경험을 제공합니다.
- 다운로드 매니저: HTTP 브레이크포인트 재시작 기능을 내장하여 GGUF 모델 전송을 지원합니다.
- MCP 지원: 도구 호출 기능 테스트를 위한 내장된 Model Context Protocol (MCP) 서버를 제공합니다.
관련
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트