PrismML-Eng/Bonsai-demo
Bonsai Demo
해결하는 문제
Bonsai는 고도로 압축된 언어 모델(1비트 및 ternary) 제품군을 제공하여, 대규모 AI 기능(비전, 추론, 도구 호출 포함)을 대규모 VRAM이나 메모리 오프로딩 없이 iPhone 또는 노트북과 같은 소비자용 하드웨어에서 로컬로 실행할 수 있도록 합니다.
작동 원리
이 프로젝트는 극한의 양자화(1비트 및 ternary 가중치)를 사용하여 모델의 메모리 점유율을 줄입니다. llama.cpp 및 MLX와 통합되어 macOS (Metal), Linux, Windows (CUDA, Vulkan, ROCm) 전반에 걸쳐 하드웨어 가속 추론을 제공합니다. 특히 27B 모델은 멀티모달 입력을 위한 비전 프로젝터와 사용자가 요청당 "사고" 노력을 할당할 수 있는 추론 메커니즘을 포함합니다.
대상
제한된 하드웨어에서 강력한 대규모 컨텍스트(최대 256k+ 토큰) 비전-언어 모델을 로컬에서 실행하고자 하는 개발자 및 AI 애호가, 그리고 극한의 양자화 형식을 테스트하는 데 관심이 있는 분들.
주요 특징
- 극한의 압축: 1.7B에서 27B 파라미터 크기의 1비트 및 ternary 모델 제품군 제공.
- 멀티모달 기능: 27B 모델은 이미지, 스크린샷 및 PDF를 지원합니다.
- 에이전트 기능: 네이티브 OpenAI 스타일의 도구 호출 및 MCP 서버 통합.
- 추론 모델: 조정 가능한 추론 예산을 갖춘 내장형 "사고" 기능.
- 폭넓은 하드웨어 지원: Apple Silicon, NVIDIA GPU 및 llama.cpp를 통한 다양한 CPU/GPU 백엔드와 호환됩니다.
- 대규모 컨텍스트: 최대 262,144 토큰의 대화를 지원합니다.