mlc-ai/web-llm

High-performance In-browser LLM Inference Engine

해결하는 문제

WebLLM은 고성능 추론 엔진으로, 대형 언어 모델(LLM)을 웹 브라우저 내부에서 직접 실행할 수 있게 합니다. 이를 통해 서버 측 처리가 필요 없어지며, 사용자의 하드웨어 가속(WebGPU)을 활용해 사용자 프라이버시를 강화하고 서버 비용을 절감합니다.

작동 방식

WebLLM은 하드웨어 가속을 위해 WebGPU를, 최적 성능을 위해 WebAssembly(WASM)를 사용합니다. 모듈형 npm 패키지로 설계되어 웹 애플리케이션에 쉽게 통합할 수 있습니다. Cache API, IndexedDB, OPFS 등 다양한 캐시 백엔드를 지원해 모델 가중치를 브라우저에 로컬 저장함으로써 매번 다운로드할 필요가 없습니다. UI 지연을 방지하기 위해 Dedicated Web Workers 또는 Service Workers에 작업을 오프로드할 수 있습니다.

대상 사용자

AI 어시스턴트, 챗봇, Chrome 확장 프로그램을 개발하고 있으며, 백엔드 인프라를 관리하지 않고 브라우저 내에서 LLM을 로컬로 배포하고 싶은 웹 개발자에게 적합합니다.

주요 특징

  • 완전한 OpenAI API 호환성: OpenAI와 동일한 스트리밍, JSON 모드, 시드 API 패턴을 사용할 수 있습니다.
  • WebGPU 가속: 클라이언트 측에서만 실행되는 고성능 추론.
  • 다양한 모델 지원: Llama 3, Phi 3, Gemma, Mistral, Qwen을 네이티브로 지원.
  • 구조화된 JSON 생성: 최첨단 JSON 모드로 구조화된 출력을 보장.
  • 유연한 배포: NPM, Yarn, CDN을 통한 통합을 지원하며, Web Workers 또는 Service Workers 내에서 실행해 성능을 향상시킬 수 있습니다.