PrismML-Eng/Bonsai-demo

Bonsai Demo

解決的問題

Bonsai 提供了一系列高度壓縮的語言模型(1-bit 和 ternary),允許在 iPhone 或筆記型電腦等消費級硬體上本地執行大規模 AI 能力——包括視覺、推理和工具呼叫——而無需消耗海量 VRAM 或進行記憶體卸載。

工作原理

該專案利用極端量化(1-bit 和 ternary 權重)來減少模型的記憶體佔用。它與 llama.cppMLX 整合,可在 macOS (Metal)、Linux 和 Windows (CUDA, Vulkan, ROCm) 上實現硬體加速推論。27B 模型特別包含了一個用於多模態輸入的視覺投影器,以及一個允許使用者為每個請求分配「思考」工作量的推理機制。

適用對象

希望在有限的硬體上本地執行強大的長上下文(高達 256k+ tokens)視覺語言模型的開發者和 AI 愛好者,以及對測試極端量化格式感興趣的人士。

亮點

  • 極端壓縮:提供從 1.7B 到 27B 參數規模的 1-bit 和 ternary 模型系列。
  • 多模態能力:27B 模型支援圖像、螢幕截圖和 PDF。
  • 代理功能:原生的 OpenAI 風格工具呼叫和 MCP 伺服器整合。
  • 推理模型:內建具有可調整推理預算的「思考」能力。
  • 廣泛的硬體支援:透過 llama.cpp 相容 Apple Silicon、NVIDIA GPU 以及各種 CPU/GPU 後端。
  • 海量上下文:支援高達 262,144 tokens 的對話。