Prism ML Bonsai 2 27B 近乎无损的三元压缩实现 9 倍体积缩减
核心要点
Prism ML 发布了 Ternary Bonsai 2 27B,这是 Qwen 3.8 27B 的三元权重(-1, 0, +1)版本。该模型仅占用 5.9 GB(每个权重 1.76 有效位),并保留了全精度模型 98.2% 的综合基准测试分数,在保持相当能力的同时实现了超过 9 倍 的体积缩减。
发布内容
- 基础模型: Qwen 3.8 27B(最先进的 270 亿参数多模态模型)。
- 压缩方案: 带有 FP16 组级缩放的三元权重,产生 1.76 位/权重的有效位。
- 模型大小: 磁盘和内存占用 5.9 GB(约为 52 GB 全精度检查点的 1/9)。
- 上下文窗口: 262 K token。
- 模态: 文本和图像输入。
- 许可证: Apache 2.0。
- 支持的运行时: NVIDIA GPU 上的 CUDA,macOS/iOS 上的 Apple MLX,以及用于 GGUF 文件的自定义 Prism 分支
llama.cpp。
基准测试性能
在涵盖推理、数学、编码、指令遵循、视觉和智能体工具使用等多个领域中,Bonsai 2 27B 得分为 83.9,达到了全精度 Qwen 3.8 27B 总分(85.4)的 98.2%。详细的各任务数据如下:
| 能力 | Bonsai 2 27B | Qwen 3.8 27B | Qwen 3.6 27B |
|---|---|---|---|
| 智能体与工具调用 (τ²‑bench) | 77.57 | 79.74 | 80.05 |
| 编码 (HumanEval+, LiveCodeBench) | 81.58 | 82.17 | 82.57 |
| 指令遵循 | 82.66 | 81.25 | 74.53 |
| 知识与推理 (MMLU‑Redux, GPQA) | 83.95 | 86.66 | 84.71 |
| 数学 (AIME, GSM8K, MATH‑500) | 96.57 | 97.06 | 94.64 |
| 视觉 (CharXiv, A‑OKVQA, OmniDocBench) | 78.59 | 81.64 | 79.82 |
| 总体 | 83.9 | 85.4 | 83.6 |
图 I: 基准测试分数(思考模式)显示,Bonsai 2 27B 在仅使用极少内存的情况下,紧密追踪全精度基准。
最值得注意的观察结果是,编码、视觉和长程智能体任务保留了大部分能力——这些领域通常在激进的量化下性能会急剧下降。
智能密度
Bonsai 2 27B 在 27 B 级模型中提供了最高的每 GB 智能密度。随附的密度图(博客中的图 II)将其置于远高于传统 8 位或 4 位量化的位置,证实了三元方案在权衡空间中是一个特例。
吞吐量与能效
| 硬件 | Tokens / 秒 (生成) | 能耗 (mWh/token) |
|---|---|---|
| NVIDIA RTX 5090 | 143 | — |
| NVIDIA RTX 4090 | — | 0.714 |
| Apple M5 Max | 46.8 | — |
在 RTX 4090 上,Bonsai 2 27B 的每个 token 能耗比全精度 8 B 模型低 40%,这使其对于电池受限的设备和持续运行的后台助手极具吸引力。
实际影响
- 本地知识工作: 支持编码助手循环、私有文档分析和多模态调试,无需云端往返。
- 硬件可访问性: 可轻松运行在 16 GB GPU(如 RTX 3060)和使用 Prism
llama.cpp分支的 Apple 芯片上。 - 经济转变: 降低了内存和电力成本,允许在数据中心机架和设备端部署中实现更高的模型密度。
社区反馈 (Hacker News 评论)
- 安装提示: 用户报告 GGUF 模型可与 Prism 的自定义
llama.cpp分支配合使用。示例命令行(macOS, M5 Pro)显示约 20 tok/s,重启后偶尔会飙升至 44 tok/s。(-ngl 99 -fa on -c 32768) - 性能差异: 一些用户在 Mac Mini M2 (16 GB RAM) 上看到 7-8 tok/s,在 6 GB GPU 上看到 0.67 tok/s,这表明流畅运行仍需要足够的 VRAM(约 8 GB)。
- 与其他量化的比较: 一条评论指出,同一基础模型的 Q2 量化(约 2.6 位/权重)处于“明显变差”的边缘,这表明 Bonsai 的三元方法提供了更好的质量与体积权衡。
- 浏览器演示: 社区构建的 WebGPU 演示完全在浏览器中运行模型,尽管用户报告在较长任务中存在不稳定性。
- 推测解码: 在 Radeon RX 7900 XTX 上使用推测解码的基准测试达到了约 89 tok/s 的生成速度和约 474 tok/s 的摄入速度,24 K 上下文的峰值 VRAM 约为 10 GiB。
- 硬件兼容性问题: 用户询问关于 AMD/HIP 的支持;一种变通方法是使用 PTQ2_0 变体,它在 AMD GPU 上更快,但需要稍多一点的 VRAM。
- 澄清: 5.9 GB 的数字是指三元权重的磁盘和内存占用;运行时内存使用量大致相同,外加缩放张量的开销。
如何开始
- 从 Hugging Face 下载 GGUF 模型:
prism-ml/Ternary-Bonsai-2-27B-gguf。 - 安装 Prism 的
llama.cpp分支 (版本prism-b10685-7dffb15)。 - 运行服务器:
./llama-prism-b10685-7dffb15/llama-server \ -m Ternary-Bonsai-2-27B-PTQ1_0.gguf \ --port 8331 -ngl 99 -fa on -c 32768 - 通过内置的 Web UI 或兼容 OpenAI 的 API 端点进行查询。
未来方向
Prism ML 的路线图提到了一个基于 Qwen 3.8 的 8 B v2 模型,目标是直接部署在手机上。社区对将三元压缩扩展到更大的 MoE 模型(例如 Qwen 3.8-Flash-Next)以及将该技术集成到 AMD/HIP 流水线中也表现出浓厚兴趣。
总结
Ternary Bonsai 2 27B 证明了近乎无损的压缩对于 27 B 级多模态模型现在是切实可行的,它提供了 6 GB 以下的占用空间、高吞吐量以及在最苛刻任务上的强大性能。此次发布缩小了尖端研究模型与日常设备硬件限制之间的差距,重塑了 AI 在整个技术栈中的部署方式。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch