Bonsai Image 4B: ローカルデバイスに高品質な画像生成をもたらす

最先端の生成AIをローカルで実行するという夢は、長らくメモリという根本的なハードウェアの制約によって阻まれてきました。クラウドAPIは絶大なパワーを提供しますが、レイテンシ、継続的なコスト、そしてプライバシーの懸念が生じ、クリエイティブな作業の反復的な性質を妨げてしまいます。これを解決するため、PrismMLは、ハイエンドなノートPCからスマートフォンまで、ローカルハードウェア向けに特別に設計されたコンパクトな画像生成モデルファミリーであるBonsai Image 4Bをリリースしました。

極端な量子化技術を活用することで、Bonsai Image 4Bは、これまでこのパラメータクラスのモデルをホストすることが不可能であったデバイス、特にiPhone上で、高品質な拡散推論を実行することを可能にします。

Bonsai Image 4Bの背後にあるエンジニアリング

Bonsai Image 4Bは、FLUX.2 Klein 4Bアーキテクチャに基づいています。モデルをゼロから再設計するのではなく、PrismMLはトランスフォーマーの重みの表現方法に焦点を当てました。拡散トランスフォーマーは、パイプラインの中で最も計算コストの高い部分であり、各デノイジングステップで繰り返し呼び出されます。これらの重みを圧縮することで、チームはメモリプレッシャーと帯域幅の要求を大幅に削減しました。

Bonsai Image 4Bには、主に2つのバリエーションがあります。

  • 1-bit Bonsai Image 4B: このバージョンは、FP16のグループ単位のスケーリング係数を用いたバイナリ {−1, +1} トランスフォーマー重みを使用し、重みあたり実効1.125ビットとなります。このバリエーションは、最大限の圧縮と最小限のデプロイメントフットプリントに最適化されています。
  • Ternary Bonsai Image 4B: このバージョンは、FP16のグループ単位のスケーリング係数を用いた {−1, 0, +1} トランスフォーマー重みを使用し、重みあたり実効1.71ビットを提供します。ゼロ状態の追加により、表現の柔軟性が高まり、それがより高い視覚的品質とより優れたプロンプト忠実度へとつながります。

メモリフットプリントの比較

安定性を維持するために、精度に敏感な投影層の数パーセント(約5%)はFP16のまま残されています。それにもかかわらず、サイズの大幅な削減は、フル精度のFLUX.2 Klein 4Bと比較して劇的です。

Model Diffusion Transformer Reduction vs FP16
FLUX.2 Klein 4B 7.75 GB 1.0x
1-bit Bonsai Image 4B 0.93 GB 8.3x
Ternary Bonsai Image 4B 1.21 GB 6.4x

Apple Silicon上で展開する場合、総ペイロード(圧縮されたテキストエンコーダーとFP16 VAEを含む)は、1-bitモデルで3.42 GB、ternaryモデルで3.88 GBとなり、フル精度のバージョンと比較して15.97 GBとなります。

アクティブな実行時(512x512の画像を生成する場合)、平均アクティブメモリ使用量は、1-bitモデルで1.5 GB、ternaryモデルで1.96 GBに低下し、元のモデルが必要とした11.74 GBから大幅に削減されました。

パフォーマンスとベンチマーク

圧縮は、モデルがその有用性を維持している場合にのみ価値があります。PrismMLは、GenEval(オブジェクトの構成)、HPSv3(人間の好み/美学)、およびDPG-Bench(意味論的忠実度)を使用してモデルを評価しました。

Ternary Bonsai Image 4Bは、品質重視の選択肢として浮上しており、トランスフォーマーのフットプリントを6.4倍削減しながら、フル精度のFLUX.2 Klein 4Bの精度の95%を維持しています。1-bitバリエーションは、8.3倍の削減を達成しながら、精度の88%を維持しています。

実用的な面では、iPhone 17 Pro Maxは512x512の画像を9.4秒で生成でき、Mac M4 Proは、約6秒で生成可能です。これは、標準的なフル精度のMFLUXパイプラインよりも最大5.6倍高速です。

ローカル推論へのシフト

PrismMLは、画像生成は品質の問題であると同時に、デプロイメントの問題でもあると主張しています。AIアートの反復的な性質(ユーザーがプロンプトを常に洗練させ、失敗作を破棄するプロセス)により、クラウドベースの往復通信は非効率的でコストがかかります。

ローカル推論は、生成をより安価に、より速く、よりプライベートにすることで、この体験をトランスフォームします。AIをリモートサービスから、統合された製品機能へと移行させます。このシフトは、ローカルAIを、高価な企業サブスクリプションから逃れ、ハードウェアの制御権を取り戻すための方法と見なすコミュニティメンバーによって支持されています。

コミュニティの視点と批判

技術的な達成は素晴らしいものですが、リリースは開発者やユーザーの間で健全な議論を沸かせました。

「実世界」の有用性

一部のユーザーは、メモリが主要なボトルネックであるか疑問を疑問視しています。あるコメントでは、GPU(8-12 GB)を持つユーザーの多くはすでに多くの拡散モデルを動かすことができるため、主たるボトルネックはストレージではなく生成時間である場合が多いと指摘されています。また、現在の1-bitモデルは、依然として比較的大きな4-bit量子化テキストエンコーダーに依存しており、それがメモリの利得をわずかに相殺しているとも指摘されています。

技術的なニュアンス

モデルのタイプに関する技術的な区別があります。拡散モデルと呼ばれていますが、技術的にはFlux.2に基づいているため、rectified flowモデルです。

また、一部のユーザーは、これがiPhoneで動作するこのクラスの最初のモデルであるという主張に異議を唱えています。他のFLUX.2 Klein 4Bの量子化バージョンが「Draw Things」のようなアプリで既に登場していることを指摘しています。

実用的な制限

初期テスターは、特定のタスクにおける混合結果を報告しています。例えば、画像内に正確なテキストをレンダリングすること(例:「a sign that says xxxx」)において、モデルがより大きなモデルと比較して苦戦していると報告されています。

利用可能状況

Bonsai Image 4Bは、Apache 2.0 licenseの下で、オープンウェイトとコードと共にリリースされています。ユーザーは、Bonsai Studio iOS app、WebGPU demo、またはHugging Faceからウェイトをダウンロードすることで、モデルを試すことができます。

Sources