PrismML-Eng/Bonsai-demo
Bonsai Demo
解決する課題
Bonsaiは、高度に圧縮された言語モデル(1ビットおよびternary)を提供します。これにより、大規模なAI機能(ビジョン、推論、ツール呼び出しを含む)を、膨大なVRAMやメモリオフロードを必要とせずに、iPhoneやノートPCなどのコンシューマー向けハードウェア上でローカルに実行することを可能にします。
仕組み
このプロジェクトは、極端な量子化(1ビットおよびternaryウェイト)を利用して、モデルのメモリフットプリントを削減します。llama.cppおよびMLXと統合されており、macOS (Metal)、Linux、Windows (CUDA, Vulkan, ROCm) にわたるハードウェアアクセラレーションによる推論を実現します。特に27Bモデルには、マルチモーダル入力用のビジョンプロジェクターと、リクエストごとに「思考」の労力を割り当てることができる推論メカニズムが組み込まれています。
対象者
限られたハードウェア上で、強力な大規模コンテキスト(最大256k+トークン)のビジョン言語モデルをローカルで実行したい開発者やAI愛好家、および極端な量子化形式のテストに興味がある方。
ハイライト
- 極限の圧縮: 1.7Bから27Bパラメータまでのサイズの1ビットおよびternaryモデルファミリーが利用可能。
- マルチモーダル機能: 27Bモデルは画像、スクリーンショット、PDFをサポート。
- エージェント機能: ネイティブなOpenAIスタイルのツール呼び出しとMCPサーバー統合。
- 推論モデル: 調整可能な推論予算を備えた組み込みの「思考」機能。
- 幅広いハードウェアサポート: Apple Silicon、NVIDIA GPU、およびllama.cppを介した様々なCPU/GPUバックエンドに対応。
- 大規模コンテキスト: 最大262,144トークンの会話をサポート。