Bonsai Image 4B:将高质量图像生成带入本地设备

在本地运行最先进的生成式 AI 的梦想长期以来一直受到一个根本性的硬件限制:内存。虽然云端 API 提供了巨大的能力,但它们引入了延迟、持续成本和隐私问题,从而抑制了创意工作的迭代性质。为了解决这个问题,PrismML 发布了 Bonsai Image 4B,这是一个专为本地硬件设计的紧凑型图像生成模型系列,范围涵盖从高端笔记本电脑到智能手机。

通过利用极端的量化技术,Bonsai Image 4B 允许高质量的扩散推理在以前无法承载此类参数规模模型的设备上运行,最显著的是 iPhone。

Bonsai Image 4B 背后的工程技术

Bonsai Image 4B 基于 FLUX.2 Klein 4B 架构构建。PrismML 并没有重新设计模型,而是专注于 transformer weights 的表示方式。扩散 transformer 是流水线中最耗费计算资源的环节,在每个去噪步骤中都会被反复调用。通过压缩这些权重,团队显著降低了内存压力和带宽需求。

Bonsai Image 4B 提供两种主要变体:

  • 1-bit Bonsai Image 4B:此版本使用二进制 {−1, +1} transformer weights,并配有 FP16 group-wise scaling factor,从而实现每个权重 1.125 个有效比特。该变体针对最大程度的压缩和最小的部署占用进行了优化。
  • Ternary Bonsai Image 4B:此版本使用 {−1, 0, +1} transformer weights,并配有 FP16 group-wise scaling factor,从而提供每个权重 1.71 个有效比特。零状态的加入允许更大的表示灵活性,这转化为更高的视觉质量和更好的 prompt fidelity。

内存占用对比

为了保持稳定性,一小部分(约 5%)对精度敏感的投影层仍保持在 FP16。尽管如此,与全精度 FLUX.2 Klein 4B 相比,体积缩减非常显著:

Model Diffusion Transformer Reduction vs FP16
FLUX.2 Klein 4B 7.75 GB 1.0x
1-bit Bonsai Image 4B 0.93 GB 8.3x
Ternary Bonsai Image 4B 1.21 GB 6.4x

当部署在 Apple Silicon 上时,1-bit 模型和 ternary 模型 的总负载(包括压缩后的 text encoder 和 FP16 VAE)分别为 3.42 GB 和 3.88 GB,而全精度版本为 15.97 GB。在运行期间(生成 512x512 图像)时,1-bit 模型的平均活跃内存使用量降至 1.5 GB,ternary 模型的平均活跃内存使用量降至 1.96 GB,相比原始版本所需的 11.74 GB 大幅减少。

性能与基准测试

压缩只有在模型保留其效用时才有价值。PrismML 使用 GenEval(对象组合)、HPSv3(人类偏好/美学)和 DPG-Bench(语义忠实度)对模型进行了评估。

Ternary Bonsai Image 4B 被视为质量导向的选择,在将 transformer footprint 降低 6.4 倍的同时,保留了全精度 FLUX.2 Klein 4B 95% 的准确度。1-bit 变体 在实现 8.3 倍缩减的同时,保留了 88% 的准确度。

在实际应用中,iPhone 17 Pro Max 可以用 9.4 秒生成 512x512 图像,而 Mac M4 Pro 大约可以用 6 秒完成——比原生的全精度 MFLUX 流水线快了多达 5.6 倍。

向本地推理的转变

PrismML 认为图像生成是一个部署问题,而不仅仅是一个质量问题。AI 艺术的迭代性质——用户不断精炼细化 prompt,并丢弃失败的结果——使得云端往返传输变得低效且昂贵。

本地推理通过使生成过程变得更便宜、更快、且更具隐私性,从而改变了这种体验。它将 AI 从远程服务转变为集成产品功能。这种转变也得到了社区成员的共鸣,他们将本地 AI 视为逃离昂贵企业订阅并重新夺回硬件控制权的一种方式。

社区观点与批评

虽然技术成就令人瞩目,但该发布引发了开发者和用户之间的健康辩论:

“现实世界”的效用

一些用户质疑内存是否是主要的瓶 颈。一位评论者指出,大多数拥有 GPU(8-12 GB)的用户已经可以运行许多扩散模型,因此主要的瓶颈往往是生成时间而非存储。其他用户指出,当前的 1-bit 模型仍然依赖于一个相对较大的 4-bit 量化后的 text encoder,这在一定程度上抵消了内存增益。

技术细节差异

关于模型类型存在一个技术区分;虽然被称为扩散模型,但它基于 Flux.2,这在技术上是一个 rectified flow model。此外,一些用户挑战了“这是其同类模型中第一个在 iPhone 上运行的模型”这一说法,指出其他 FLUX.2 Klein 4B 的量化版本已经出现在像

Sources