PrismML-Eng/Bonsai-demo
Bonsai Demo
解決的問題
Bonsai-demo 提供了一種簡化的途徑,可在各種硬體(Mac、Linux、Windows)和後端(Metal、CUDA、Vulkan、ROCm、CPU)上本地運行高度壓縮、高效率的語言模型。它特別針對在消費級硬體上執行大型模型的挑戰,提供 Bonsai 模型家族的 1 位與三值(2 位)量化版本。
工作原理
本專案結合使用 GGUF(透過 llama.cpp)與 MLX 格式,部署參數量從 17 億到 270 億的模型。270 億參數的模型是支援處理影像、截圖與 PDF 的視覺-語言模型。系統利用專用的量化技術(1 位與三值)來減少記憶體佔用——例如,1 位的 Bonsai-27B 可運行於現代 iPhone 上。專案包含設定腳本,可自動完成相依性安裝、模型下載,以及配置具 UI(Open WebUI)的聊天伺服器,支援代理工具呼叫與推理努力設定。
適用對象
- 本地 LLM 愛好者:希望在顯存有限或消費級硬體上執行大型模型的人。
- 開發者:希望將視覺-語言功能與代理工具呼叫整合至本地工作流程的人。
- Mac 使用者:希望透過 MLX 實現最佳化效能的人。
主要亮點
- 極端量化:提供 1 位與三值-Bonsai(2 位)版本,以最小化記憶體使用。
- 多模態能力:270 億模型支援視覺(影像/PDF)與長上下文(最多 256k+ token)。
- 代理功能:原生支援 OpenAI 風格的工具呼叫與 MCP 伺服器整合。
- 推理控制:提供「思考」模型,使用者可針對每次對話調整推理努力程度(關閉至最大)。
- 預測解碼:在相容硬體上可選支援 dspark 作圖器,實現更快的解碼速度。
- 廣泛硬體支援:支援 macOS、Linux 與 Windows,使用多種 GPU 後端。
相關
- Dispatch
- Dispatch
- Dispatch
- 專案
- 專案