mlc-ai/web-llm

High-performance In-browser LLM Inference Engine

해결하는 문제

WebLLM은 브라우저 내에서 고성능 대규모 언어 모델(LLM) 추론을 직접 제공합니다. 서버 측 처리가 필요 없으며, 사용자의 하드웨어에서 로컬로 AI 애플리케이션을 실행할 수 있어 개인정보 보호를 강화하고 서버 비용을 절감할 수 있습니다.

작동 방식

WebLLM은 하드웨어 가속을 위해 WebGPU를, 최적의 성능을 위해 WebAssembly(WASM)를 활용합니다. 모듈형 npm 패키지로 설계되어 웹 애플리케이션에 쉽게 통합할 수 있습니다. 모델 가중치를 로컬에 저장하기 위해 Cache API, IndexedDB, OPFS 등의 다양한 캐시 백엔드를 지원하며, UI 차단을 방지하기 위해 Web Workers 또는 Service Workers로 오프로드할 수 있습니다.

대상 사용자

백엔드 인프라를 관리하지 않고도 로컬에서 GPU 가속 LLM 기능을 제공하고 싶은 AI 어시스턴트, 챗봇, 브라우저 확장 기능을 개발하는 웹 개발자.

주요 특징

  • 완전한 OpenAI API 호환성: 스트리밍, JSON 모드, 시드 설정 등 다양한 오픈소스 모델에서 동일한 API 사용 가능.
  • 브라우저 내 실행: WebGPU를 사용해 클라이언트 측에서 완전히 실행되어 데이터가 브라우저 외부로 나가지 않습니다.
  • 광범위한 모델 지원: Llama 3, Phi 3, Gemma, Mistral, Qwen 등을 네이티브로 지원.
  • 구조화된 생성: 보장된 구조화된 출력을 위한 고성능 JSON 모드 구현.
  • 유연한 배포: NPM, Yarn, CDN을 통한 통합을 지원하며 Chrome 확장 기능 내에서도 작동 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트