spiritbuun/buun-llama-cpp
Experimental llama.cpp fork for inference research and development
它解決了什麼
buun-llama-cpp 是 llama.cpp 的實驗性研究分支,旨在最大化 VRAM 受限硬體上的 LLM 推論效率。它透過引入動態 KV 快取量化與先進的 MoE(混合專家)快取策略,具體解決了上下文長度、記憶體使用量與模型品質之間的取捨。
運作方式
此專案實作了幾項關鍵的技術創新:
- 可變位元率(VBR)KV 快取:VBR 不使用固定的量化等級,而是隨著會話增長動態量化 KV 快取。它從 FP16 開始,僅在 VRAM 壓力需要時,才依預先定義的「階梯」編解碼器逐層降級,確保當前上下文深度能獲得最高可能的品質。
- Trellis 編碼量化(TCQ):一種專門的編解碼器,使用 512 狀態的 Trellis 與 Viterbi 編碼,在極低位元率(2-3 位元)下,與標準標量量化相比,能顯著降低 KL 散度(誤差)。
- MoE 快取:對於大型 MoE 模型(如 DeepSeek V4 Flash),它允許被路由的專家駐留在系統 RAM 中,同時將「熱門」專家張量快取在備用 VRAM 中以加速推論。
- 視覺的 GPU 交換:為了節省 VRAM,它可以在處理影像時,暫時卸載推論性解碼元件,以將視覺編碼器(
mmproj)載入 GPU,然後再交換回來。
適用對象
在消費級 GPU(例如 RTX 3090)上處理大型模型的開發者與研究人員,他們需要在不過度犧牲模型準確度的情況下,突破上下文視窗大小與推論速度的極限。
重點特色
- 動態品質控制:VBR 允許快取從 FP16 優雅地降級至 1.25 位元/值。
- 高效能編解碼器:TCQ 在 3.25 位元/值下提供接近 FP16 的困惑度。
- 自適應 MoE 管理:針對大型 MoE 模型的自動擬合與專家並行分派。
- VRAM 最佳化:在視覺編碼器與推論性解碼輔助元件之間進行智慧交換。
相關
- Dispatch
- 專案
- 專案
- Dispatch
- Dispatch