Prism ML Bonsai 2 27B 近乎無損的三元壓縮實現了 9 倍的體積縮減

重點摘要

Prism ML 發布了 Ternary Bonsai 2 27B,這是 Qwen 3.8 27B 的三元權重(-1, 0, +1)版本,僅佔用 5.9 GB(每個權重 1.76 個有效位元),並保留了全精度模型 98.2% 的綜合基準測試分數,在提供相當能力的同時,實現了超過 9 倍 的體積縮減。


這是什麼發布

  • 基礎模型: Qwen 3.8 27B(最先進的 270 億參數多模態模型)。
  • 壓縮方案: 帶有 FP16 組級縮放的三元權重,產生每個權重 1.76 個有效位元。
  • 模型大小: 磁碟與記憶體中為 5.9 GB(約為 52 GB 全精度檢查點的 1/9)。
  • 上下文視窗: 262 K 個 token。
  • 模態: 文字與影像輸入。
  • 授權: Apache 2.0。
  • 支援的執行環境: NVIDIA GPU 上的 CUDA、macOS/iOS 上的 Apple MLX,以及用於 GGUF 檔案的自訂 Prism 分支 llama.cpp

基準測試效能

在多樣化的套件(推理、數學、程式設計、指令遵循、視覺、代理工具使用)中,Bonsai 2 27B 得分為 83.9,這是全精度 Qwen 3.8 27B 綜合得分(85.4)的 98.2%。詳細的各項任務數據如下:

能力 Bonsai 2 27B Qwen 3.8 27B Qwen 3.6 27B
代理與工具呼叫 (τ²‑bench) 77.57 79.74 80.05
程式設計 (HumanEval+, LiveCodeBench) 81.58 82.17 82.57
指令遵循 82.66 81.25 74.53
知識與推理 (MMLU‑Redux, GPQA) 83.95 86.66 84.71
數學 (AIME, GSM8K, MATH‑500) 96.57 97.06 94.64
視覺 (CharXiv, A‑OKVQA, OmniDocBench) 78.59 81.64 79.82
總體 83.9 85.4 83.6

圖 I: 基準測試分數(思考模式)顯示,Bonsai 2 27B 在使用極少記憶體的情況下,緊密追蹤全精度基準。

最重要的觀察結果是,程式設計、視覺和長程代理任務保留了大部分能力——這些領域通常在激進的量化下會出現嚴重退化。


智慧密度

Bonsai 2 27B 在 27B 類別模型中提供了最高的「每 GB 智慧密度」。隨附的密度圖(部落格中的圖 II)將其置於遠高於傳統 8 位元或 4 位元量化的位置,證實了三元方案在權衡空間中是一個異常值。


吞吐量與能源效率

硬體 Tokens / 秒 (生成) 能源 (mWh/token)
NVIDIA RTX 5090 143
NVIDIA RTX 4090 0.714
Apple M5 Max 46.8

在 RTX 4090 上,Bonsai 2 27B 每個 token 的能耗比全精度 8B 模型 低 40%,這使其對於電池受限的裝置和持續背景運行的助手極具吸引力。


現實世界的影響

  • 本地知識工作: 實現了程式設計助手迴圈、私人文件分析和多模態除錯,無需雲端往返。
  • 硬體可及性: 可輕鬆安裝在 16 GB GPU(例如 RTX 3060)和使用 Prism llama.cpp 分支的 Apple 晶片上。
  • 經濟轉變: 降低了記憶體和電力成本,允許在資料中心機架和裝置端部署中實現更高的模型密度。

社群回饋 (Hacker News 評論)

  • 安裝提示: 使用者回報 GGUF 模型可與 Prism 的自訂 llama.cpp 分支配合使用。範例命令列(macOS, M5 Pro)顯示約 20 tok/s,重啟後偶爾會飆升至 44 tok/s。 (-ngl 99 -fa on -c 32768)
  • 效能差異: 一些使用者在 Mac Mini M2 (16 GB RAM) 上看到 7-8 tok/s,在 6 GB GPU 上看到 0.67 tok/s,這表明流暢運作仍需要足夠的 VRAM (約 8 GB)。
  • 與其他量化的比較: 一則評論指出,同一基礎模型的 Q2 量化(約 2.6 位元/權重)處於「明顯變差」的邊緣,這表明 Bonsai 的三元方法提供了更好的品質與大小權衡。
  • 瀏覽器演示: 社群構建的 WebGPU 演示完全在瀏覽器中執行該模型,儘管使用者回報在較長任務中不穩定。
  • 推測解碼: 在 Radeon RX 7900 XTX 上進行推測解碼的基準測試達到了約 89 tok/s 的生成速度和約 474 tok/s 的攝取速度,24 K 上下文的峰值 VRAM 約為 10 GiB。
  • 硬體相容性問題: 使用者詢問關於 AMD/HIP 的支援;一種解決方法是使用 PTQ2_0 變體,它在 AMD GPU 上更快,但需要稍微多一點的 VRAM。
  • 澄清: 5.9 GB 的數字是指三元權重在磁碟和記憶體中的佔用空間;執行時記憶體使用量大致相同,外加縮放張量的開銷。

如何開始

  1. 從 Hugging Face 下載 GGUF 模型: prism-ml/Ternary-Bonsai-2-27B-gguf
  2. 安裝 Prism 的 llama.cpp 分支 (版本 prism-b10685-7dffb15)。
  3. 執行伺服器:
    ./llama-prism-b10685-7dffb15/llama-server \
        -m Ternary-Bonsai-2-27B-PTQ1_0.gguf \
        --port 8331 -ngl 99 -fa on -c 32768
    
  4. 透過內建的 Web UI 或 OpenAI 相容的 API 端點進行查詢。

未來方向

Prism ML 的路線圖提到了基於 Qwen 3.8 的 8B v2 模型,目標是直接部署在手機上。社群對於將三元壓縮擴展到更大的 MoE 模型(例如 Qwen 3.8-Flash-Next)以及將該技術整合到 AMD/HIP 管線中也表現出高度興趣。


總結

Ternary Bonsai 2 27B 證明了近乎無損的壓縮對於 27B 規模的多模態模型現在是切實可行的,它提供了小於 6 GB 的佔用空間、高吞吐量以及在最苛刻任務上的強大效能。此發布縮小了尖端研究模型與日常裝置硬體限制之間的差距,重塑了 AI 在整個技術堆疊中的部署方式。

Sources

相關