xorbitsai/inference

Swap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.

해결하는 문제

Xinference는 대규모 AI 모델의 배포와 서빙을 단순화합니다. 다양한 모델 유형에 대한 인프라 설정의 복잡성을 제거하여 사용자가 단일 명령어로 최첨단 오픈소스 모델을 배포할 수 있도록 합니다.

작동 방식

Xinference는 텍스트(LLM), 음성 인식, 멀티모달 모델 등 다양한 모달리티를 지원하는 모델 서빙 레이어로 작동합니다. vLLM과 ggml과 같은 엔진을 활용하여 이질적 하드웨어(GPU 및 CPU) 전반에서 성능을 최적화합니다. OpenAI 호환 RESTful API, WebUI, Python 클라이언트 등 다양한 상호작용 인터페이스를 제공하며, 여러 머신에 걸친 분산 배포를 지원합니다.

대상 사용자

실험 또는 프로덕션 환경에서 AI 모델을 호스팅하고 서빙하는 쉬운 방법을 필요로 하는 연구자, 개발자, 데이터 사이언티스트를 위해 설계되었습니다.

주요 특징

  • 멀티모달 지원: 언어, 오디오, 이미지 모델(텍스트에서 이미지로) 및 임베딩 모델을 서빙합니다.
  • 이질적 하드웨어: GPU와 CPU(ggml를 통해)를 모두 지능적으로 활용하며, Metal과 같은 플랫폼을 지원합니다.
  • 분산 서빙: 모델 추론을 여러 장치나 머신에 분산하여 실행할 수 있도록 합니다.
  • OpenAI 호환성: 함수 호출(function calling) 지원을 포함하여 OpenAI와 호환되는 RESTful API를 제공합니다.
  • 광범위한 통합: LangChain, LlamaIndex, Dify, RAGFlow와 같은 프레임워크와 원활하게 작동합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트