Prism ML Bonsai 2 27B 近乎無損的三元壓縮實現了 9 倍的體積縮減
重點摘要
Prism ML 發布了 Ternary Bonsai 2 27B,這是 Qwen 3.8 27B 的三元權重(-1, 0, +1)版本,僅佔用 5.9 GB(每個權重 1.76 個有效位元),並保留了全精度模型 98.2% 的綜合基準測試分數,在提供相當能力的同時,實現了超過 9 倍 的體積縮減。
這是什麼發布
- 基礎模型: Qwen 3.8 27B(最先進的 270 億參數多模態模型)。
- 壓縮方案: 帶有 FP16 組級縮放的三元權重,產生每個權重 1.76 個有效位元。
- 模型大小: 磁碟與記憶體中為 5.9 GB(約為 52 GB 全精度檢查點的 1/9)。
- 上下文視窗: 262 K 個 token。
- 模態: 文字與影像輸入。
- 授權: Apache 2.0。
- 支援的執行環境: NVIDIA GPU 上的 CUDA、macOS/iOS 上的 Apple MLX,以及用於 GGUF 檔案的自訂 Prism 分支
llama.cpp。
基準測試效能
在多樣化的套件(推理、數學、程式設計、指令遵循、視覺、代理工具使用)中,Bonsai 2 27B 得分為 83.9,這是全精度 Qwen 3.8 27B 綜合得分(85.4)的 98.2%。詳細的各項任務數據如下:
| 能力 | Bonsai 2 27B | Qwen 3.8 27B | Qwen 3.6 27B |
|---|---|---|---|
| 代理與工具呼叫 (τ²‑bench) | 77.57 | 79.74 | 80.05 |
| 程式設計 (HumanEval+, LiveCodeBench) | 81.58 | 82.17 | 82.57 |
| 指令遵循 | 82.66 | 81.25 | 74.53 |
| 知識與推理 (MMLU‑Redux, GPQA) | 83.95 | 86.66 | 84.71 |
| 數學 (AIME, GSM8K, MATH‑500) | 96.57 | 97.06 | 94.64 |
| 視覺 (CharXiv, A‑OKVQA, OmniDocBench) | 78.59 | 81.64 | 79.82 |
| 總體 | 83.9 | 85.4 | 83.6 |
圖 I: 基準測試分數(思考模式)顯示,Bonsai 2 27B 在使用極少記憶體的情況下,緊密追蹤全精度基準。
最重要的觀察結果是,程式設計、視覺和長程代理任務保留了大部分能力——這些領域通常在激進的量化下會出現嚴重退化。
智慧密度
Bonsai 2 27B 在 27B 類別模型中提供了最高的「每 GB 智慧密度」。隨附的密度圖(部落格中的圖 II)將其置於遠高於傳統 8 位元或 4 位元量化的位置,證實了三元方案在權衡空間中是一個異常值。
吞吐量與能源效率
| 硬體 | Tokens / 秒 (生成) | 能源 (mWh/token) |
|---|---|---|
| NVIDIA RTX 5090 | 143 | — |
| NVIDIA RTX 4090 | — | 0.714 |
| Apple M5 Max | 46.8 | — |
在 RTX 4090 上,Bonsai 2 27B 每個 token 的能耗比全精度 8B 模型 低 40%,這使其對於電池受限的裝置和持續背景運行的助手極具吸引力。
現實世界的影響
- 本地知識工作: 實現了程式設計助手迴圈、私人文件分析和多模態除錯,無需雲端往返。
- 硬體可及性: 可輕鬆安裝在 16 GB GPU(例如 RTX 3060)和使用 Prism
llama.cpp分支的 Apple 晶片上。 - 經濟轉變: 降低了記憶體和電力成本,允許在資料中心機架和裝置端部署中實現更高的模型密度。
社群回饋 (Hacker News 評論)
- 安裝提示: 使用者回報 GGUF 模型可與 Prism 的自訂
llama.cpp分支配合使用。範例命令列(macOS, M5 Pro)顯示約 20 tok/s,重啟後偶爾會飆升至 44 tok/s。 (-ngl 99 -fa on -c 32768) - 效能差異: 一些使用者在 Mac Mini M2 (16 GB RAM) 上看到 7-8 tok/s,在 6 GB GPU 上看到 0.67 tok/s,這表明流暢運作仍需要足夠的 VRAM (約 8 GB)。
- 與其他量化的比較: 一則評論指出,同一基礎模型的 Q2 量化(約 2.6 位元/權重)處於「明顯變差」的邊緣,這表明 Bonsai 的三元方法提供了更好的品質與大小權衡。
- 瀏覽器演示: 社群構建的 WebGPU 演示完全在瀏覽器中執行該模型,儘管使用者回報在較長任務中不穩定。
- 推測解碼: 在 Radeon RX 7900 XTX 上進行推測解碼的基準測試達到了約 89 tok/s 的生成速度和約 474 tok/s 的攝取速度,24 K 上下文的峰值 VRAM 約為 10 GiB。
- 硬體相容性問題: 使用者詢問關於 AMD/HIP 的支援;一種解決方法是使用 PTQ2_0 變體,它在 AMD GPU 上更快,但需要稍微多一點的 VRAM。
- 澄清: 5.9 GB 的數字是指三元權重在磁碟和記憶體中的佔用空間;執行時記憶體使用量大致相同,外加縮放張量的開銷。
如何開始
- 從 Hugging Face 下載 GGUF 模型:
prism-ml/Ternary-Bonsai-2-27B-gguf。 - 安裝 Prism 的
llama.cpp分支 (版本prism-b10685-7dffb15)。 - 執行伺服器:
./llama-prism-b10685-7dffb15/llama-server \ -m Ternary-Bonsai-2-27B-PTQ1_0.gguf \ --port 8331 -ngl 99 -fa on -c 32768 - 透過內建的 Web UI 或 OpenAI 相容的 API 端點進行查詢。
未來方向
Prism ML 的路線圖提到了基於 Qwen 3.8 的 8B v2 模型,目標是直接部署在手機上。社群對於將三元壓縮擴展到更大的 MoE 模型(例如 Qwen 3.8-Flash-Next)以及將該技術整合到 AMD/HIP 管線中也表現出高度興趣。
總結
Ternary Bonsai 2 27B 證明了近乎無損的壓縮對於 27B 規模的多模態模型現在是切實可行的,它提供了小於 6 GB 的佔用空間、高吞吐量以及在最苛刻任務上的強大效能。此發布縮小了尖端研究模型與日常裝置硬體限制之間的差距,重塑了 AI 在整個技術堆疊中的部署方式。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch