llmmanorg/llmman

Run any agent on any model, models stored as OCI images

해결하는 문제

llmman은 AI 에이전트와 모델을 실행하기 위한 통합 인터페이스로, 다양한 추론 서버, 모델 형식, 제공자 관리의 번거로움을 제거합니다. 사용자는 로컬 머신에서 호스팅되거나 호스팅 제공자를 통해 제공되는 모델과 상관없이, 단일 명령어로 에이전트(예: Claude Code 또는 Aider)를 실행할 수 있습니다.

작동 방식

llmman은 모델 다운로드, 서빙, 라우팅을 처리하는 관리 계층입니다. 표준 OCI(Open Container Initiative) 아티팩트를 사용하여 모델을 패키지화하고 저장하며, Docker Hub, GHCR, 또는 Hugging Face에서 모델을 가져올 수 있습니다. 로컬 추론을 위해 llama.cpp, vLLM, SGLang, mlx-lm 등의 상류 엔진을 그대로 활용하며 모델 파일을 수정하지 않습니다. Ollama, OpenAI, Anthropic API와 호환되는 단일 API 엔드포인트를 제공하며, 이를 적절한 로컬 백엔드 또는 호스팅 제공자로 라우팅합니다.

대상 사용자

특정 제공자나 레지스트리에 종속되지 않고, 다양한 하드웨어(로컬 또는 클라우드)에서 다양한 에이전트와 모델을 실행하고자 하는 개발자 및 AI 연구자. 또한 공기 격리 또는 규정 준수 환경에서 안전하고 서명된 모델 전송이 필요한 사용자.

주요 기능

  • 제공자 및 레지스트리 독립성: Hugging Face 또는 어떤 OCI 레지스트리에서든 모델을 직접 가져오고, 단일 엔드포인트를 사용해 로컬 또는 호스팅 제공자로 요청을 라우팅.
  • 단일 단계 전송: 모델을 로컬에 저장하지 않고도 레지스트리 간(예: Hugging Face → 개인 OCI 레지스트리)으로 직접 전송 가능.
  • 하드웨어 풀링(집계): 여러 대의 머신에서 llmman serve를 실행하여 네트워크 전체에 걸쳐 모델 부하를 분산하는 단일 논리적 엔드포인트를 구성.
  • 통합 API: Ollama, OpenAI, Anthropic API를 동시에 지원하는 단일 서버.
  • 크로스 모델 하이브리드 쌍: 로컬 모델의 컨텍스트 창이 초과되면 자동으로 호스팅 제공자로 요청을 라우팅.
  • 보안 모델 검증: cosign 형식의 서명을 지원하여 레지스트리에서 가져온 모델의 진위를 검증 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트