PrismML-Eng/Bonsai-demo

Bonsai Demo

해결하는 문제

Bonsai는 고도로 압축된 언어 모델(1비트 및 ternary) 제품군을 제공하여, 대규모 AI 기능(비전, 추론, 도구 호출 포함)을 대규모 VRAM이나 메모리 오프로딩 없이 iPhone 또는 노트북과 같은 소비자용 하드웨어에서 로컬로 실행할 수 있도록 합니다.

작동 원리

이 프로젝트는 극한의 양자화(1비트 및 ternary 가중치)를 사용하여 모델의 메모리 점유율을 줄입니다. llama.cppMLX와 통합되어 macOS (Metal), Linux, Windows (CUDA, Vulkan, ROCm) 전반에 걸쳐 하드웨어 가속 추론을 제공합니다. 특히 27B 모델은 멀티모달 입력을 위한 비전 프로젝터와 사용자가 요청당 "사고" 노력을 할당할 수 있는 추론 메커니즘을 포함합니다.

대상

제한된 하드웨어에서 강력한 대규모 컨텍스트(최대 256k+ 토큰) 비전-언어 모델을 로컬에서 실행하고자 하는 개발자 및 AI 애호가, 그리고 극한의 양자화 형식을 테스트하는 데 관심이 있는 분들.

주요 특징

  • 극한의 압축: 1.7B에서 27B 파라미터 크기의 1비트 및 ternary 모델 제품군 제공.
  • 멀티모달 기능: 27B 모델은 이미지, 스크린샷 및 PDF를 지원합니다.
  • 에이전트 기능: 네이티브 OpenAI 스타일의 도구 호출 및 MCP 서버 통합.
  • 추론 모델: 조정 가능한 추론 예산을 갖춘 내장형 "사고" 기능.
  • 폭넓은 하드웨어 지원: Apple Silicon, NVIDIA GPU 및 llama.cpp를 통한 다양한 CPU/GPU 백엔드와 호환됩니다.
  • 대규모 컨텍스트: 최대 262,144 토큰의 대화를 지원합니다.