Bonsai Image 4B:將高品質影像生成帶入本地裝置
在本地運行尖端生成式 AI 的夢想長期以來一直受到一個根本性的硬體限制所阻礙:記憶體。雖然雲端 API 提供強大的能力,但它們會帶來延遲、持續的成本以及隱私疑慮,進而抑制了創意工作的迭代性質。為了縮短這一差距,PrismML 發布了 Bonsai Image 4B,這是一個專為本地硬體設計的緊湊型影像生成模型系列,適用範圍從高階筆記型電腦到智慧型手機。
透過利用極端量化技術,Bonsai Image 4B 讓高品質的擴散推論(diffusion inference)能夠在先前無法承載此參數級別模型的裝置上運行,其中最著名的就是 iPhone。
Bonsai Image 4B 背後的工程技術
Bonsai Image 4B 是基於 FLUX.2 Klein 4B 架構構建的。PrismML 並非從頭重新設計模型,而是將重點放在 transformer 權重的表示方式上。擴散 transformer 是管線中最耗費運算資源的部分,在每個去噪步驟中都會被反覆調用。透過壓縮這些權重,團隊顯著降低了記憶體壓力與頻寬需求。
Bonsai Image 4B 提供兩種主要的變體:
- 1-bit Bonsai Image 4B:此版本使用二進位 {−1, +1} transformer 權重,並搭配 FP16 group-wise scaling factor,使得每個權重有效位元數為 1.125 bits。此變體針對最大程度的壓縮與最小化的部署足跡進行了優化。
- Ternary Bonsai Image 4B:此版本使用 {−1, 0, +1} transformer 權重,並搭配 FP16 group-wise scaling factor,提供 1.71 bits 的有效權重位元數。加入零狀態(zero state)提供了更大的表示靈活性,這轉化為更高的視覺品質與更好的提示詞忠實度。
記憶體占用比較
為了維持穩定性,一小部分(約 5%)對精度敏感的投影層(projection layers)仍保持在 FP16。儘管如此,與全精度 FLUX.2 Klein 4B 相比,尺寸縮減非常顯著:
| Model | Diffusion Transformer | Reduction vs FP16 |
|---|---|---|
| FLUX.2 Klein 4B | 7.75 GB | 1.0x |
| 1-bit Bonsai Image 4B | 0.93 GB | 8.3x |
| Ternary Bonsai Image 4B | 1.21 GB | 6.4x |
當部署在 Apple Silicon 上時,1-bit 模型(包括壓縮後的 text encoder 與 FP16 VAE)的總負載為 3.42 GB,ternary 模型為 3.88 GB,而全精度版本則為 15.97 GB。在運行時(生成 512x512 影像)的平均活躍記憶體使用量,1-bit 模型降至 1.5 GB,ternary 模型降至 1.96 GB,相較於原始版本所需的 11.74 GB 實現了巨大的縮減。
性能與基準測試
壓縮只有在模型保留其效用時才有價值。PrismML 使用 GenEval(物件組成)、HPSv3(人類偏好/美學)以及 DPG-Bench(語義忠實度)對模型進行了評估。
Ternary Bonsai Image 4B 被視為品質導向的選擇,在將 transformer 足跡縮減 6.4 倍的同時,保留了全精度 FLUX.2 Klein 4B 95% 的準確度。1-bit 變體則在實現 8.3 倍縮減的同時,保留了 88% 的準確度。
在實際應用中,iPhone 17 Pro Max 可在 9.4 秒內生成 512x512 影像,而 Mac M4 Pro 約可在 6 秒內完成——比原生的全精度 MFLUX 管線快了高達 5.6 倍。
向本地推論的轉型
PrismML 主張,影像生成既是一個部署問題,也是一個品質問題。AI 藝術的迭代性質——使用者不斷精煉提示詞並捨棄失敗的結果——使得雲端往返傳輸變得低效且昂貴。
本地推論透過讓生成變得更便宜、更快且具備隱私性,改變了這種體驗。它將 AI 從遠端服務轉變為整合式的產品功能。社群成員也對此表示認同,他們將本地 AI 視為為逃避昂貴的企業訂閱並重新奪回硬體控制權的一種方式。
社群觀點與評論
雖然技術成就令人印象深刻,但此發布也引發了開發者與使用者之間的健康辯論:
「真實世界」的效用
部分使用者質疑記憶體是否為主要的瓶頸。一位評論者指出,大多數擁有 GPU(8-12 GB)的使用者已可以運行許多擴散模型,因此主要的瓶題頸往往是生成時間而非儲存空間。此外,有人指出目前的 1-bit 模型仍依賴於相對較大的 4-bit 量化 text encoder,這稍微抵消了記憶體增益。
技術細節差異
在模型類型上存在技術上的區別;雖然被稱為擴散模型,但它基於 Flux.2,這在技術上屬於 rectified flow model。此外,有些使用者挑戰了「這是首個在 iPhone 上運行的同類別模型」的說稱,指出其他 FLUX.2 Klein 4B 的量化版本已出現在像是 "Draw Things" 等應用程式中。
實際限制
早期測試者報告在特定任務中結果不一,例如在影像中渲染精確的文字(例如,「a sign that says xxxx"),據稱該模型與較大的對應模型相比表現較吃力。
提供方式
Bonsai Image 4B 以 Apache 2.0 license 發布,並提供開放權重與程式碼。使用者可以透過 Bonsai Studio iOS app、WebGPU demo,或從 Hugging Face 下載權重來體驗這些模型。