PrismML-Eng/Bonsai-demo
Bonsai Demo
何を解決するか
Bonsai-demo は、さまざまなハードウェア(Mac、Linux、Windows)およびバックエンド(Metal、CUDA、Vulkan、ROCm、CPU)で、極めて圧縮され、高性能な言語モデルをローカルで実行するための簡潔な方法を提供します。特に、大規模モデルをコンシューマー向けハードウェアで実行する課題に対処し、Bonsaiモデルファミリーの1ビットおよび3値(2ビット)量子化バージョンを提供します。
仕組み
このプロジェクトは、llama.cpp を通じた GGUF と MLX 形式の組み合わせを使用して、1.7B から 27B パラメータのモデルを展開します。27B モデルは、画像、スクリーンショット、PDF を処理できる視覚言語モデルです。特殊な量子化(1ビットおよび3値)により、メモリ使用量を削減します。たとえば、1ビットの Bonsai-27B は現代の iPhone に収まります。セットアップスクリプトにより、依存関係のインストール、モデルのダウンロード、UI を備えたチャットサーバー(Open WebUI)の構成が自動化されています。これはエージェントツール呼び出しと推論努力設定をサポートしています。
対象ユーザー
- ローカル LLM ファン:限られた VRAM またはコンシューマー向けハードウェアで大規模モデルを実行したい人。
- 開発者:ローカルワークフローに視覚言語機能とエージェントツール呼び出しを統合したい人。
- Mac ユーザー:MLX を通じて最適化されたパフォーマンスを求める人。
特徴
- 極端な量子化:メモリ使用量を最小限に抑えるために、1ビットおよび3値-Bonsai(2ビット)バージョンを提供。
- マルチモーダル機能:27B モデルは視覚(画像/PDF)と長文脈(最大256k+トークン)をサポート。
- エージェント機能:ネイティブな OpenAI 風のツール呼び出しと MCP サーバー統合。
- 推論制御:チャットごとに推論努力(オフから最大)を調整できる「思考」モデル。
- 予測的デコード:互換性のあるハードウェア上で高速デコードを可能にするオプションの dspark ドラフトサポート。
- 広範なハードウェア対応:Mac、Linux、Windows で、さまざまな GPU バックエンドを使用可能。
関連
- Dispatch
- Dispatch
- Dispatch
- プロジェクト
- プロジェクト