PrismML-Eng/Bonsai-demo

Bonsai Demo

解决的问题

Bonsai 提供了一系列高度压缩的语言模型(1-bit 和 ternary),允许在 iPhone 或笔记本电脑等消费级硬件上本地运行大规模 AI 能力——包括视觉、推理和工具调用——而无需消耗海量 VRAM 或进行内存卸载。

工作原理

该项目利用极端量化(1-bit 和 ternary 权重)来减少模型的内存占用。它与 llama.cppMLX 集成,可在 macOS (Metal)、Linux 和 Windows (CUDA, Vulkan, ROCm) 上实现硬件加速推理。27B 模型特别包含了一个用于多模态输入的视觉投影器,以及一个允许用户为每个请求分配“思考”工作量的推理机制。

适用对象

希望在有限的硬件上本地运行强大的长上下文(高达 256k+ token)视觉语言模型的开发者和 AI 爱好者,以及对测试极端量化格式感兴趣的人士。

亮点

  • 极端压缩:提供从 1.7B 到 27B 参数规模的 1-bit 和 ternary 模型系列。
  • 多模态能力:27B 模型支持图像、屏幕截图和 PDF。
  • 智能体功能:原生的 OpenAI 风格工具调用和 MCP 服务器集成。
  • 推理模型:内置具有可调节推理预算的“思考”能力。
  • 广泛的硬件支持:通过 llama.cpp 兼容 Apple Silicon、NVIDIA GPU 以及各种 CPU/GPU 后端。
  • 海量上下文:支持高达 262,144 token 的对话。