PrismML-Eng/Bonsai-demo

Bonsai Demo

何を解決するか

Bonsai-demo は、さまざまなハードウェア(Mac、Linux、Windows)およびバックエンド(Metal、CUDA、Vulkan、ROCm、CPU)で、極めて圧縮され、高性能な言語モデルをローカルで実行するための簡潔な方法を提供します。特に、大規模モデルをコンシューマー向けハードウェアで実行する課題に対処し、Bonsaiモデルファミリーの1ビットおよび3値(2ビット)量子化バージョンを提供します。

仕組み

このプロジェクトは、llama.cpp を通じた GGUF と MLX 形式の組み合わせを使用して、1.7B から 27B パラメータのモデルを展開します。27B モデルは、画像、スクリーンショット、PDF を処理できる視覚言語モデルです。特殊な量子化(1ビットおよび3値)により、メモリ使用量を削減します。たとえば、1ビットの Bonsai-27B は現代の iPhone に収まります。セットアップスクリプトにより、依存関係のインストール、モデルのダウンロード、UI を備えたチャットサーバー(Open WebUI)の構成が自動化されています。これはエージェントツール呼び出しと推論努力設定をサポートしています。

対象ユーザー

  • ローカル LLM ファン:限られた VRAM またはコンシューマー向けハードウェアで大規模モデルを実行したい人。
  • 開発者:ローカルワークフローに視覚言語機能とエージェントツール呼び出しを統合したい人。
  • Mac ユーザー:MLX を通じて最適化されたパフォーマンスを求める人。

特徴

  • 極端な量子化:メモリ使用量を最小限に抑えるために、1ビットおよび3値-Bonsai(2ビット)バージョンを提供。
  • マルチモーダル機能:27B モデルは視覚(画像/PDF)と長文脈(最大256k+トークン)をサポート。
  • エージェント機能:ネイティブな OpenAI 風のツール呼び出しと MCP サーバー統合。
  • 推論制御:チャットごとに推論努力(オフから最大)を調整できる「思考」モデル。
  • 予測的デコード:互換性のあるハードウェア上で高速デコードを可能にするオプションの dspark ドラフトサポート。
  • 広範なハードウェア対応:Mac、Linux、Windows で、さまざまな GPU バックエンドを使用可能。

関連