mlc-ai/mlc-llm

Universal LLM Deployment Engine with ML Compilation

What it solves

MLC LLM은 방대한 하드웨어 플랫폼과 운영 체제에서 대규모 언어 모델(LLMs)을 네이티브로 배포할 수 있는 방법을 제공합니다. AI 모델 실행 시 하드웨어 특정적인 장벽을을 제거하여, 하이엔드 GPU부터 모바일 폰과 웹 브라우저에 이르기까지 모든 장치에서 효율적으로 실행할 수 있게 합니다.

How it works

이 프로젝트는 머신러닝 컴파일러를 사용하여 특정 하드웨어에 맞게 LLM을 변환 및 최적화합니다. 이 모델들을 통합 고성능 추론 엔진인 MLCEngine에서 실행합니다. 이 엔진은 OpenAI 호환 API를 제공하여 REST servers, Python, JavaScript, iOS, Android를 통해 애플리케이션에 통합하기 매우 쉽습니다.

Who it’s for

다양한 하드웨어(AMD, NVIDIA, Apple, Intel GPU) 및 다양한 플랫폼(Linux, Windows, macOS, iOS, Android, Web Browsers)에 LLM을 배포해야 하는 개발자.

Highlights

  • Universal Deployment: 다양한 GPU (Vulkan, ROCm, CUDA, Metal, OpenCL) 및 플랫폼을 지원합니다.
  • ML Compilation: 컴파일러를 사용하여 모델을 네이티브 성능으로 최적화합니다.
  • OpenAI-compatible API: 표준 API 형식을 통해 통합을 간편하게 만듭니다.
  • Broad Platform Support: 데스크톱, 모바일 및 웹 브라우저(WebGPU 및 WASM을 통해)에서 네이티브로 작동합니다.