mlc-ai/web-llm
High-performance In-browser LLM Inference Engine
해결하는 문제
WebLLM은 브라우저 내에서 고성능 대규모 언어 모델(LLM) 추론을 직접 제공합니다. 서버 측 처리가 필요 없으며, 사용자의 하드웨어에서 로컬로 AI 애플리케이션을 실행할 수 있어 개인정보 보호를 강화하고 서버 비용을 절감할 수 있습니다.
작동 방식
WebLLM은 하드웨어 가속을 위해 WebGPU를, 최적의 성능을 위해 WebAssembly(WASM)를 활용합니다. 모듈형 npm 패키지로 설계되어 웹 애플리케이션에 쉽게 통합할 수 있습니다. 모델 가중치를 로컬에 저장하기 위해 Cache API, IndexedDB, OPFS 등의 다양한 캐시 백엔드를 지원하며, UI 차단을 방지하기 위해 Web Workers 또는 Service Workers로 오프로드할 수 있습니다.
대상 사용자
백엔드 인프라를 관리하지 않고도 로컬에서 GPU 가속 LLM 기능을 제공하고 싶은 AI 어시스턴트, 챗봇, 브라우저 확장 기능을 개발하는 웹 개발자.
주요 특징
- 완전한 OpenAI API 호환성: 스트리밍, JSON 모드, 시드 설정 등 다양한 오픈소스 모델에서 동일한 API 사용 가능.
- 브라우저 내 실행: WebGPU를 사용해 클라이언트 측에서 완전히 실행되어 데이터가 브라우저 외부로 나가지 않습니다.
- 광범위한 모델 지원: Llama 3, Phi 3, Gemma, Mistral, Qwen 등을 네이티브로 지원.
- 구조화된 생성: 보장된 구조화된 출력을 위한 고성능 JSON 모드 구현.
- 유연한 배포: NPM, Yarn, CDN을 통한 통합을 지원하며 Chrome 확장 기능 내에서도 작동 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트