Bonsai-demo: 高度压缩的 1-bit 和 三进制模型,使消费设备能够进行本地视觉和推理

Bonsai-demo: 高度压缩的 1-bit 和 三进制模型,使消费设备能够进行本地视觉和推理

它解决了什么

Bonsai 提供了一系列高度压缩的语言模型(1-bit 和 三进制),使得大规模 AI 能力——包括视觉、推理和工具调用——能够在消费硬件上本地运行,例如 iPhone 或笔记本电脑,而无需巨大的 VRAM 或内存卸载。

它是如何工作的

该项目利用极端量化(1-bit 和 三进制权重)来减少模型的内存占用。它与 llama.cppMLX 集成,以在 macOS(Metal)、Linux 和 Windows(CUDA、Vulkan、ROCm)上实现硬件加速推理。27B 模型特别加入了用于多模态输入的视觉投影器以及一个推理机制,使用户能够为每个请求预算“思考”工作量。

适用于谁

希望在受限硬件上本地运行强大的大上下文(最多 256k+ tokens)视觉语言模型的开发者和 AI 爱好者,以及对测试极端量化格式感兴趣的人士。

亮点

  • 极端压缩:1-bit 和 三进制模型系列提供从 1.7B 到 27B 参数的各种规模。
  • 多模态能力:27B 模型支持图像、截图和 PDF。
  • 代理特性:原生 OpenAI 风格的工具调用和 MCP 服务器集成。
  • 推理模型:内置可调节推理预算的“思考”能力。
  • 广泛硬件支持:通过 llama.cpp 兼容 Apple Silicon、NVIDIA GPU 以及各种 CPU/GPU 后端。
  • 巨大上下文:支持最多 262,144 tokens 的对话。

Sources