PrismML-Eng/Bonsai-demo
Bonsai Demo
解决的问题
Bonsai-demo 提供了一种简化的方法,可在各种硬件(Mac、Linux、Windows)和后端(Metal、CUDA、Vulkan、ROCm、CPU)上本地运行高度压缩、高性能的语言模型。它特别解决了在消费级硬件上运行大型模型的挑战,提供了 Bonsai 模型系列的 1 位和三值(2 位)量化版本。
工作原理
该项目结合使用 GGUF(通过 llama.cpp)和 MLX 格式,部署参数量从 17 亿到 270 亿的模型。270 亿参数的模型是支持处理图像、截图和 PDF 的视觉-语言模型。系统利用专门的量化技术(1 位和三值)来减少内存占用——例如,1 位的 Bonsai-27B 可以运行在现代 iPhone 上。项目包含设置脚本,可自动完成依赖安装、模型下载以及配置带有 UI(Open WebUI)的聊天服务器,支持代理工具调用和推理努力设置。
适用人群
- 本地 LLM 爱好者:希望在显存有限或消费级硬件上运行大型模型的人。
- 开发者:希望将视觉-语言功能和代理工具调用集成到本地工作流中的人。
- Mac 用户:希望借助 MLX 实现优化性能的人。
主要亮点
- 极端量化:提供 1 位和三值-Bonsai(2 位)版本,以最小化内存使用。
- 多模态能力:270 亿模型支持视觉(图像/PDF)和长上下文(最多 256k+ 个 token)。
- 代理功能:原生支持 OpenAI 风格的工具调用和 MCP 服务器集成。
- 推理控制:提供“思考”模型,用户可为每次聊天调整推理努力程度(关闭至最大)。
- 推测解码:在兼容硬件上可选支持 dspark 作图器,实现更快的解码速度。
- 广泛硬件支持:支持 macOS、Linux 和 Windows,使用多种 GPU 后端。
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- 项目