Prism ML Bonsai 2 27B 近乎无损的三元压缩实现 9 倍体积缩减

核心要点

Prism ML 发布了 Ternary Bonsai 2 27B,这是 Qwen 3.8 27B 的三元权重(-1, 0, +1)版本。该模型仅占用 5.9 GB(每个权重 1.76 有效位),并保留了全精度模型 98.2% 的综合基准测试分数,在保持相当能力的同时实现了超过 9 倍 的体积缩减。


发布内容

  • 基础模型: Qwen 3.8 27B(最先进的 270 亿参数多模态模型)。
  • 压缩方案: 带有 FP16 组级缩放的三元权重,产生 1.76 位/权重的有效位。
  • 模型大小: 磁盘和内存占用 5.9 GB(约为 52 GB 全精度检查点的 1/9)。
  • 上下文窗口: 262 K token。
  • 模态: 文本和图像输入。
  • 许可证: Apache 2.0。
  • 支持的运行时: NVIDIA GPU 上的 CUDA,macOS/iOS 上的 Apple MLX,以及用于 GGUF 文件的自定义 Prism 分支 llama.cpp

基准测试性能

在涵盖推理、数学、编码、指令遵循、视觉和智能体工具使用等多个领域中,Bonsai 2 27B 得分为 83.9,达到了全精度 Qwen 3.8 27B 总分(85.4)的 98.2%。详细的各任务数据如下:

能力 Bonsai 2 27B Qwen 3.8 27B Qwen 3.6 27B
智能体与工具调用 (τ²‑bench) 77.57 79.74 80.05
编码 (HumanEval+, LiveCodeBench) 81.58 82.17 82.57
指令遵循 82.66 81.25 74.53
知识与推理 (MMLU‑Redux, GPQA) 83.95 86.66 84.71
数学 (AIME, GSM8K, MATH‑500) 96.57 97.06 94.64
视觉 (CharXiv, A‑OKVQA, OmniDocBench) 78.59 81.64 79.82
总体 83.9 85.4 83.6

图 I: 基准测试分数(思考模式)显示,Bonsai 2 27B 在仅使用极少内存的情况下,紧密追踪全精度基准。

最值得注意的观察结果是,编码、视觉和长程智能体任务保留了大部分能力——这些领域通常在激进的量化下性能会急剧下降。


智能密度

Bonsai 2 27B 在 27 B 级模型中提供了最高的每 GB 智能密度。随附的密度图(博客中的图 II)将其置于远高于传统 8 位或 4 位量化的位置,证实了三元方案在权衡空间中是一个特例。


吞吐量与能效

硬件 Tokens / 秒 (生成) 能耗 (mWh/token)
NVIDIA RTX 5090 143
NVIDIA RTX 4090 0.714
Apple M5 Max 46.8

在 RTX 4090 上,Bonsai 2 27B 的每个 token 能耗比全精度 8 B 模型低 40%,这使其对于电池受限的设备和持续运行的后台助手极具吸引力。


实际影响

  • 本地知识工作: 支持编码助手循环、私有文档分析和多模态调试,无需云端往返。
  • 硬件可访问性: 可轻松运行在 16 GB GPU(如 RTX 3060)和使用 Prism llama.cpp 分支的 Apple 芯片上。
  • 经济转变: 降低了内存和电力成本,允许在数据中心机架和设备端部署中实现更高的模型密度。

社区反馈 (Hacker News 评论)

  • 安装提示: 用户报告 GGUF 模型可与 Prism 的自定义 llama.cpp 分支配合使用。示例命令行(macOS, M5 Pro)显示约 20 tok/s,重启后偶尔会飙升至 44 tok/s。(-ngl 99 -fa on -c 32768)
  • 性能差异: 一些用户在 Mac Mini M2 (16 GB RAM) 上看到 7-8 tok/s,在 6 GB GPU 上看到 0.67 tok/s,这表明流畅运行仍需要足够的 VRAM(约 8 GB)。
  • 与其他量化的比较: 一条评论指出,同一基础模型的 Q2 量化(约 2.6 位/权重)处于“明显变差”的边缘,这表明 Bonsai 的三元方法提供了更好的质量与体积权衡。
  • 浏览器演示: 社区构建的 WebGPU 演示完全在浏览器中运行模型,尽管用户报告在较长任务中存在不稳定性。
  • 推测解码: 在 Radeon RX 7900 XTX 上使用推测解码的基准测试达到了约 89 tok/s 的生成速度和约 474 tok/s 的摄入速度,24 K 上下文的峰值 VRAM 约为 10 GiB。
  • 硬件兼容性问题: 用户询问关于 AMD/HIP 的支持;一种变通方法是使用 PTQ2_0 变体,它在 AMD GPU 上更快,但需要稍多一点的 VRAM。
  • 澄清: 5.9 GB 的数字是指三元权重的磁盘和内存占用;运行时内存使用量大致相同,外加缩放张量的开销。

如何开始

  1. 从 Hugging Face 下载 GGUF 模型: prism-ml/Ternary-Bonsai-2-27B-gguf
  2. 安装 Prism 的 llama.cpp 分支 (版本 prism-b10685-7dffb15)。
  3. 运行服务器:
    ./llama-prism-b10685-7dffb15/llama-server \
        -m Ternary-Bonsai-2-27B-PTQ1_0.gguf \
        --port 8331 -ngl 99 -fa on -c 32768
    
  4. 通过内置的 Web UI 或兼容 OpenAI 的 API 端点进行查询。

未来方向

Prism ML 的路线图提到了一个基于 Qwen 3.8 的 8 B v2 模型,目标是直接部署在手机上。社区对将三元压缩扩展到更大的 MoE 模型(例如 Qwen 3.8-Flash-Next)以及将该技术集成到 AMD/HIP 流水线中也表现出浓厚兴趣。


总结

Ternary Bonsai 2 27B 证明了近乎无损的压缩对于 27 B 级多模态模型现在是切实可行的,它提供了 6 GB 以下的占用空间、高吞吐量以及在最苛刻任务上的强大性能。此次发布缩小了尖端研究模型与日常设备硬件限制之间的差距,重塑了 AI 在整个技术栈中的部署方式。

Sources

相关