Bonsai-demo: 高度压缩的 1-bit 和 三进制模型,使消费设备能够进行本地视觉和推理
Bonsai-demo: 高度压缩的 1-bit 和 三进制模型,使消费设备能够进行本地视觉和推理
它解决了什么
Bonsai 提供了一系列高度压缩的语言模型(1-bit 和 三进制),使得大规模 AI 能力——包括视觉、推理和工具调用——能够在消费硬件上本地运行,例如 iPhone 或笔记本电脑,而无需巨大的 VRAM 或内存卸载。
它是如何工作的
该项目利用极端量化(1-bit 和 三进制权重)来减少模型的内存占用。它与 llama.cpp 和 MLX 集成,以在 macOS(Metal)、Linux 和 Windows(CUDA、Vulkan、ROCm)上实现硬件加速推理。27B 模型特别加入了用于多模态输入的视觉投影器以及一个推理机制,使用户能够为每个请求预算“思考”工作量。
适用于谁
希望在受限硬件上本地运行强大的大上下文(最多 256k+ tokens)视觉语言模型的开发者和 AI 爱好者,以及对测试极端量化格式感兴趣的人士。
亮点
- 极端压缩:1-bit 和 三进制模型系列提供从 1.7B 到 27B 参数的各种规模。
- 多模态能力:27B 模型支持图像、截图和 PDF。
- 代理特性:原生 OpenAI 风格的工具调用和 MCP 服务器集成。
- 推理模型:内置可调节推理预算的“思考”能力。
- 广泛硬件支持:通过 llama.cpp 兼容 Apple Silicon、NVIDIA GPU 以及各种 CPU/GPU 后端。
- 巨大上下文:支持最多 262,144 tokens 的对话。