Bonsai-demo: 高度壓縮的 1-bit 和三元模型,使消費設備能在本地執行視覺與推理

Bonsai-demo: 高度壓縮的 1-bit 和三元模型,使消費設備能在本地執行視覺與推理

它解決了什麼

Bonsai 提供一系列高度壓縮的語言模型(1-bit 和三元),使得大規模 AI 能力——包括視覺、推理和工具調用——能夠在消費硬體上本地運行,例如 iPhone 或筆電,而無需巨額的 VRAM: Bonsai 提供一系列高度壓縮的語言模型(1-bit 和三元),使得大規模 AI 能力——包括視覺、推理和工具調用——能夠在消費硬體上本地運行,例如 iPhone 或筆電,而無需巨額的 VRAM 或記憶體卸載。

它是如何運作的

該項目利用極端量化(1-bit 和三元權重)來減少模型的記憶體佔用。它透過 llama.cppMLX 進行硬體加速推理,支援 macOS (Metal)、Linux 和 Windows (CUDA, Vulkan, ROCm)。27B 模型具體包含一個用於多模態輸入的視覺投影器,以及一個允許使用者按請求預算「思考」工作量的推理機制。

適合誰使用

希望在有限硬體上本地運行強大的大上下文(最多 256k+ 個 token)視覺語言模型的開發者和 AI 愛好者,以及對測試極端量化格式感興趣的人。

特色

  • 極致壓縮:1-bit 和三元模型系列提供從 1.7B 到 27B 參數的各種規模。
  • 多模態能力:27B 模型支援圖片、螢幕截圖和 PDF。
  • 代理功能:原生 OpenAI 風格的工具調用與 MCP 伺服器整合。
  • 推理模型:內建可調整推理預算的「思考」能力。
  • 廣泛硬體支援:透過 llama.cpp 與 Apple Silicon、NVIDIA GPU 以及各種 CPU/GPU 後端相容。
  • 巨量上下文:支援最多 262,144 個 token 的對話。

Sources