ChonkLM: WebGPU를 이용해 작은 언어 모델을 브라우저로 가져오기
대규모 언어 모델(LLM)의 환경은 종종 방대한 파라미터 수와 무거운 클라우드 의존성에 의해 지배됩니다. 그러나 "작은" 모델에 대한 성장하는 추세는 효율성, 프라이버시 및 로컬 실행에 초점을 옮기고 있습니다. ChonkLM은 이러한 변화를 대표하는 사례로, 사용자가 작은 언어 모델(SLM)을 웹 브라우저에서 직접, 완전히 오프라인으로 실행할 수 있게 하는 특화된 추론 런타임을 제공합니다.
WebGPU를 활용함으로써 ChonkLM은 비용이 많이 드는 서버 측 인프라의 필요성을 없애고, 토큰이 사용자 기기를 떠나지 않도록 보장합니다. 이 아키텍처는 프라이버시를 강화할 뿐만 아니라 API 호출에 따른 지연 시간과 비용도 감소시킵니다.
WebGPU를 통한 로컬 추론
ChonkLM은 근본적으로 접근성을 위해 설계되었습니다. WebGPU를 지원하는 모든 디바이스를 대상으로 하며, 사용자는 2분 이내에 로컬 AI를 시작할 수 있습니다. 여기서의 기술적 성과는 모델 가중치와 실행을 브라우저 샌드박스 내에서 처리하고, 클라이언트의 GPU를 가속화에 활용할 수 있다는 점입니다.
플랫폼은 캐싱 메커니즘을 기반으로 작동합니다: 사용자는 모델을 선택하고, 필요한 가중치를 로컬 브라우저 캐시에 다운로드한 뒤 추론을 수행합니다. 이 "한 번 다운로드, 어디서든 실행(오프라인)" 방식은 인터넷 연결이 불안정한 환경이나 데이터 주권 요구가 엄격한 사용자에게 유용한 도구가 됩니다.
다양한 작은 모델 라이브러리
ChonkLM은 역사적 베이스라인부터 최신 SLM에 이르기까지 다양한 모델을 지원합니다. 사용 가능한 모델은 주요 기능(채팅, 완성, 특수 작업)별로 분류되며, 성능과 메모리 사용량의 균형을 맞추기 위해 q4, q8과 같은 다양한 양자화 레벨로 제공됩니다.
최신 채팅 및 지시 모델
- Gemma 3 (270M): Google의 최신 소규모 모델로, 다양한 양자화(
241MB278MB)로 제공됩니다. - LFM2.5 (350M): 채팅 및 구조화된 추출에 최적화된 모델(
219MB362MB). - SmolLM2 (135M & 360M): Hugging Face의 효율적인 지시 모델이며, 135M 버전은 최소 101MB만 차지합니다.
- Granite 4.0 H (350M): IBM의 하이브리드 Mamba/attention 모델로, 표준 Transformer를 넘어선 대안 아키텍처를 보여줍니다(
213MB349MB).
특수 및 실험적 모델
- Qwen3 (0.6B): "생각" 기능을 도입한 더 큰 "작은" 모델로, 더 많은 메모리가 필요합니다(
462MB767MB). - Monad & Baguettotron: PleIAs의 특수 모델로, 프랑스어 전용 채팅 모델(Baguettotron)과 단일 턴 사고 모델(Monad)을 포함합니다.
- OpenELM (270M): Apple의 기여 모델로, 가변 Grouped-Query Attention(GQA)을 특징으로 합니다.
역사적 베이스라인
로컬 LLM의 진화를 살펴보고 싶은 사람들을 위해, ChonkLM은 GPT-2와 distilgpt2와 같은 OpenAI의 레거시 모델을 포함하고 있으며, 이들은 81MB 정도의 작은 용량을 가진 완성 전용 베이스라인으로 활용됩니다.
"작은" 트렌드의 기술적 함의
브라우저 런타임에서 이러한 모델을 사용할 수 있게 된 것은 AI 생태계에서 몇 가지 주요 기술적 변화를 강조합니다:
- 양자화는 필수: GGUF와 WGSL 포맷을 사용하면 모델을 크게 손실 없이 압축(양자화)할 수 있어, 일반 소비자 브라우저의 제한된 VRAM에 맞출 수 있습니다.
- 아키텍처 다양성: IBM의 Mamba-하이브리드와 Apple의 가변 GQA를 포함함으로써, 업계가 비-Transformer 또는 변형된 Transformer 아키텍처를 실험하여 적은 파라미터로 더 높은 성능을 끌어내고 있음을 보여줍니다.
- 엣지 인텔리전스: 추론을 브라우저로 옮김으로써, ChonkLM은 백엔드가 필요 없는 지능형 에이전트를 위한 애플리케이션 플랫폼으로서 브라우저가 활용되는 "Edge AI" 경로를 제시합니다.
모델 용량 요약
| 모델 패밀리 | 크기 (대략) | 주요 사용 사례 |
|---|---|---|
| SmolLM2-135M | 101MB - 138MB | 기본 채팅 |
| LFM2.5-350M | 219MB - 362MB | 구조화된 추출 |
| Gemma 3-270M | 241MB - 278MB | 일반 채팅 |
| Qwen3-0.6B | 462MB - 767MB | 생각이 포함된 채팅 |
| GPT-2 | 108MB - 417MB | 완성 베이스라인 |