bentoml/OpenLLM

Run any open-source LLMs, such as DeepSeek and Llama, as OpenAI compatible API endpoint in the cloud.

What it solves

OpenLLM은 오픈 소스 대규모 언어 모델(LLM)의 셀프 호스팅 프로세스를 간소화합니다. 추론 서버를 설정하는 복잡성을 제거하여, 개발자가 Llama 3.3, Qwen2.5, Phi3와 같은 모델을 단일 명령어로 OpenAI 호환 API로 실행할 수 있게 해줍니다.

How it works

OpenLLM은 기본 저장소 또는 사용자 정의 저장소에서 모델을 서빙할 수 있는 CLI 도구를 제공합니다. 최첨단 추론 백엔드(vLLM 등)를 활용하며, BentoML과 통합되어 프로덕션급 배포가 가능합니다. 사용자는 openllm serve를 사용하여 로컬에서 서버를 시작하고, 내장된 채팅 UI 또는 CLI를 통해 모델과 상호작용할 수 있으며, openllm deploy를 사용하여 BentoCloud를 통해 클라우드에 배포할 수 있습니다.

Who it’s for

독점적인 API에 의존하지 않으면서 OpenAI API 표준과의 호환성을 유지하며, 로컬 또는 클라우드에서 자체 LLM을 호스팅하고자 하는 개발자 및 기업 AI 팀.

Highlights

  • OpenAI-Compatible APIs: 기존 도구 및 프레임워크(LlamaIndex 등)가 셀프 호스팅된 모델과 원활하게 작동하도록 합니다.
  • BentoCloud Integration: Docker 및 Kubernetes를 사용하여 기업용 클라우드 배포를 위한 간소화된 워크플로우를 제공합니다.
  • Extensive Model Support: Llama, Mistral, Gemma, DeepSeek를 포함한 광범위한 오픈 소스 모델을 지원합니다.
  • Custom Model Repositories: 독점 또는 특화된 모델을 실행하기 위해 사용자 정의 모델 저장소를 추가할 수 있는 기능.
  • Built-in Chat UI: 호스팅된 모델과 즉시 상호작용할 수 있는 웹 기반 인터페이스를 포함합니다.