PrismML-Eng/Bonsai-demo
Bonsai Demo
해결하는 문제
Bonsai-demo는 다양한 하드웨어(Mac, Linux, Windows)와 백엔드(Metal, CUDA, Vulkan, ROCm, CPU)에서 매우 압축되고 고성능의 언어 모델을 로컬에서 실행할 수 있도록 간편한 방법을 제공합니다. 특히 대규모 모델을 소비자용 하드웨어에서 실행하는 문제를 해결하기 위해 Bonsai 모델 패밀리의 1비트 및 3진(2비트) 양자화 버전을 제공합니다.
작동 방식
이 프로젝트는 llama.cpp를 통해 GGUF와 MLX 형식을 결합하여 1.7B에서 27B 파라미터 규모의 모델을 배포합니다. 27B 모델은 이미지, 스크린샷, PDF를 처리할 수 있는 시각-언어 모델입니다. 특수 양자화(1비트 및 3진)를 활용하여 메모리 사용량을 줄이며, 예를 들어 1비트 Bonsai-27B는 현대의 iPhone에도 적재 가능합니다. 설정 스크립트를 통해 종속성 설치, 모델 다운로드, UI를 갖춘 챗 서버(Open WebUI) 구성이 자동화되며, 에이전트 도구 호출 및 추론 노력 설정을 지원합니다.
대상 사용자
- 로컬 LLM 애호가: 제한된 VRAM 또는 소비자용 하드웨어에서 대규모 모델을 실행하고 싶은 사용자.
- 개발자: 로컬 워크플로우에 시각-언어 기능과 에이전트 도구 호출을 통합하고 싶은 사용자.
- Mac 사용자: MLX를 통해 최적화된 성능을 원하는 사용자.
주요 특징
- 극한 양자화: 메모리 사용량을 최소화하기 위해 1비트 및 3진-Bonsai(2비트) 버전 제공.
- 다중 모달 기능: 27B 모델은 시각(이미지/PDF)과 긴 컨텍스트(최대 256k+ 토큰)를 지원.
- 에이전트 기능: 네이티브 OpenAI 스타일 도구 호출 및 MCP 서버 통합.
- 추론 제어: 사용자가 채팅당 추론 노력(해제에서 최대)을 조정할 수 있는 '사고' 모델.
- 예측적 디코딩: 호환 가능한 하드웨어에서 더 빠른 디코딩을 위한 선택적 dspark 드래프터 지원.
- 광범위한 하드웨어 지원: 다양한 GPU 백엔드를 사용해 macOS, Linux, Windows에서 모두 작동.
관련
- Dispatch
- Dispatch
- Dispatch
- 프로젝트
- 프로젝트