MicroLLM Lab는 WebGPU를 통해 브라우저에 7개의 작은 LLM을 가져옵니다

TL;DR

MicroLLM Lab는 WebGPU를 통해 브라우저 내에서 7개의 작은 언어 모델(25M–360M 파라미터)을 로드하고 대화하며 벤치마크할 수 있게 해주며, 10ms 미만의 첫 토큰 지연, 서버 비용 없음, 완전한 프라이버시를 제공합니다.

Lab가 제공하는 기능

답변: 이 사이트는 백엔드 없이 사용자가 7개의 Q4 양자화 모델 중 하나를 로드하고, 디바이스에서 추론을 실행하며 벤치마크 결과를 확인할 수 있는 UI를 제공합니다.

  • 모델: PetitGPT‑research‑v1 (125 M), SmolLM2 135M Instruct, L20‑Edu 135M, SmolLM2 360M Instruct, MiniMind2 104M, MiniMind2 Small 26M, GPT‑2 124M (nanoGPT‑shaped). 모든 모델은 Apache‑2.0 또는 MIT 라이선스이며, 4비트 양자화 후 15 MB에서 216 MB 사이입니다.
  • 하드웨어 가속: WebGPU가 사용 가능한 경우, 추론은 GPU에서 100–300 토큰 / 초 속도로 실행되며, WASM 대체 경로의 8–20 토큰/초보다 10–20배 빠릅니다. UI는 현재 속도를 보고하며, 공유 가능한 성능 인증서를 생성할 수 있습니다.
  • 프라이버시 및 비용: 모든 계산은 브라우저 내에서 이루어지며, 프롬프트는 디바이스를 떠나지 않으며, API 요금이 없습니다.
  • 사용 사례 중심: 엣지 분류, 스팸 필터링, 의도 추출 및 대규모 클라우드 LLM을 호출하기 전에 트리거할 수 있는 모든 작업.

시작 방법

답변: 모델 로드는 세 단계 과정입니다.

  1. 로드 – 모델 카드의 로드 버튼을 클릭하면 모델이 IndexedDB에 캐시됩니다(파일 시스템 다운로드 없음).
  2. 채팅 – 로드된 모델을 선택하고 채팅 패널에서 프롬프트를 입력합니다. 토큰/초 속도는 실시간으로 표시됩니다.
  3. 벤치마크 – 벤치마크 탭으로 전환하여 객관적인 테스트(정규식 기반 검사) 세트를 실행하고 피크 및 지속적인 토큰 속도를 기록하는 성능 인증서를 생성합니다.

UI는 사용자가 자바스크립트 벤치마크 정의를 작성할 수 있는 사용자 정의 평가 편집기도 제공합니다.

기술적 기반

답변: Lab는 네 가지 핵심 기술에 의존합니다.

  • 작은 언어 모델(SLM): 광범위한 지식보다 엣지 추론을 위해 설계된 작고 컴팩트한 트랜스포머(25M–360M 파라미터).
  • Q4 양자화: 가중치는 4비트 정수로 저장되어 1억 파라미터 모델을 약 50MB로 축소하면서 생성 품질을 유지합니다.
  • WebGPU: W3C 표준으로, 컴퓨트 셰이더를 네이티브 GPU API(Metal, DirectX 12, Vulkan)에 매핑합니다. 사용 가능한 경우 WASM 대체 경로보다 10–20배 빠릅니다.
  • IndexedDB 캐시: 모델은 브라우저의 개인 저장소에 세션 간 지속되며, 반복 다운로드를 제거합니다.

사용자들의 성능 관찰

답변: 커뮤니티 피드백은 장점과 단점 양쪽을 강조합니다.

"지금은 로컬에서 얼마나 많은 일을 할 수 있는지 놀랍습니다. 훨씬 느릴 것이라 예상했지만, 예상보다 빠르게 동작합니다." – Mbarley

"브라우저 내 실행 속도가 놀랍습니다. 백엔드 없이 빠른 데모에 완벽합니다." – hbroom

"CPU 대체 경로에서는 8–20 토큰/초만 나오지만, WebGPU를 사용하면 100–300 토큰/초로 뛰어오릅니다. 10–20배 향상입니다." – Lab 문서

보고된 문제:

  • UI의 밀도와 작은 글꼴로 인해 인터페이스 탐색이 어려움 (demibabs의 의견).
  • 일부 브라우저(Firefox)는 WebGPU 지원이 없어 GPUShaderStage is not defined와 같은 오류 발생 (anonimous-emacs 및 langurmonkey의 의견).
  • 더 큰 프롬프트에서 출력이 비논리적이거나 반복되는 경우가 있음 (not2b, Schlagbohrer, botanrice의 의견).

샘플 모델 동작

답변: 모델들은 다양한 능력을 보여줍니다.

  • PetitGPT research‑v1은 산술 문제를 올바르게 해결하지만 때때로 추가 단계를 더합니다: "2 + 2 = 4 … 그래서, 2 + 2 = 4 + 2."
  • SmolLM2 360M은 완전히 잘못된 사실을 제공합니다(예: 캘리포니아 인구가 1억 5300만 명이라고 주장).
  • L20‑Edu는 설득력 있는 코드 조각을 생성할 수 있지만, 채우기 텍스트를 반복할 수 있습니다.

이 예시들은 지연 시간이 우수하지만 사실 정확도는 여전히 제한적임을 보여줍니다.

커뮤니티 확장 및 관련 프로젝트

답변: 여러 개발자가 브라우저 내 LLM의 개념을 기반으로 프로젝트를 진행하고 있습니다.

  • tiny.tobelabs.com – Tiny Stories 모델과 더 큰 QA 모델을 위한 최소 UI (atobe의 의견).
  • sonistellar.com/lab – 또 다른 WebGPU 기반 LLM 놀이터 (vs4vijay의 의견).
  • Web Models API – 오픈 웨이트 모델을 디바이스에서 실행하기 위한 표준화된 브라우저 API 제안 (kenzic의 의견).
  • Three‑LLM – ThreeJS의 쉐이딩 언어를 사용해 브라우저에서 LLM을 실행 (bhouston의 의견).

실용적인 통찰

답변: MicroLLM Lab는 4비트 양자화된 SLM이 현대 브라우저에서 인터랙티브 속도로 실행될 수 있음을 보여주며, 저비용, 프라이버시 보장 애플리케이션에 엣지 AI를 가능하게 합니다.

  • 사용할 때: 지연 시간과 비용이 사실 지식보다 더 중요한 실시간 분류, 의도 라우팅, 프로토타이핑.
  • 사용하지 말아야 할 때: 높은 사실 정확도, 다국어 지원, 복잡한 추론이 필요한 작업; 모델은 종종 환각되거나 반복됩니다.
  • 미래 방향: WebGPU의 보급(특히 Firefox에서)과 개선된 UI/UX는 접근성을 넓힐 것입니다. 디바이스 내 모델 API의 표준화는 개발자들의 접근 장벽을 더 낮출 수 있습니다.

모든 정보는 MicroLLM Lab 사이트 및 위에 링크된 Hacker News 토론 스레드에서 유래했습니다.

Sources

관련

  • Dispatch
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트