Bonsai-demo: altamente 압축된 1비트 및 삼진 모델, 소비자 기기에서 로컬 비전 및 추론을 가능하게 함

Bonsai-demo: altamente 압축된 1비트 및 삼진 모델, 소비자 기기에서 로컬 비전 및 추론을 가능하게 함

해결하는 문제

Bonsai는 대규모 AI 기능—비전, 추론, 툴 호출 등을 포함하여—소비자 하드웨어(예: iPhone 또는 노트북)에서 로컬로 실행할 수 있도록 허용하는 고도로 압축된 언어 모델(1비트 및 삼진) 제품군을 제공합니다. 이를 위해 massive VRAM 또는 메모리 오프로딩이 필요하지 않습니다.

작동 원리

이 프로젝트는 모델의 메모리 사용량을 줄이기 위해 극단적인 양자화(1비트 및 삼진 가중치)를 활용합니다. llama.cppMLX와 통합되어 macOS(Metal), Linux, Windows(CUDA, Vulkan, ROCm)에서 하드웨어 가속 추론을 지원합니다. 27B 모델은 멀티모달 입력을 위한 비전 프로젝터와 사용자가 요청당 '생각' 노력량을 예산화할 수 있는 추론 메커니즘을 구체적으로 포함합니다.

대상 사용자

제한된 하드웨어에서 강력한 대용량 컨텍스트(256k+ 토큰까지) 비전-언어 모델을 로컬로 실행하고 싶은 개발자 및 AI 애호가, 그리고 극단적인 양자화 형식을 테스트해보고 싶은 사람들을 대상으로 합니다.

주요 특징

  • 극한 압축: 1.7B에서 27B 매개변수 규모의 1비트 및 삼진 모델 제품군을 사용할 수 있습니다.
  • 멀티모달 기능: 27B 모델은 이미지, 스크린샷, PDF를 지원합니다.
  • 에이전틱 기능: 네이티브 OpenAI-style 툴 호출 및 MCP 서버 통합.
  • 추론 모델: 조정 가능한 추론 예산과 함께 내장된 '생각' 기능.
  • 광범위한 하드웨어 지원: llama.cpp를 통해 Apple Silicon, NVIDIA GPU 및 다양한 CPU/GPU 백엔드와 호환됩니다.
  • 대규모 컨텍스트: 262,144 토큰까지의 대화를 지원합니다.

Bonsai를 실행하기 위한 데모 저장소로, 소비자 하드웨어에서 비전, 추론 및 툴 호출 기능을 가능하게 하는 1비트 및 삼진 양자화 언어 모델 제품군을 제공합니다.

Bonsai-demo: altamente 압축된 1비트 및 삼진 모델, 소비자 기기에서 로컬 비전 및 추론을 가능하게 함}

Sources