spiritbuun/buun-llama-cpp

Experimental llama.cpp fork for inference research and development

它解决了什么

buun-llama-cppllama.cpp 的实验性研究分支,旨在最大化 VRAM 受限硬件上的 LLM 推理效率。它通过引入动态 KV 缓存量化与先进的 MoE(混合专家)缓存策略,具体解决了上下文长度、内存使用量与模型质量之间的权衡。

运作方式

此项目实现了多项关键技术革新:

  • 可变比特率(VBR)KV 缓存:VBR 不使用固定的量化级别,而是随着会话增长动态量化 KV 缓存。它从 FP16 开始,仅在 VRAM 压力需要时,才按预定义的“阶梯”编解码器逐层降级,确保当前上下文深度能获得最高可能的质量。
  • Trellis 编码量化(TCQ):一种专门的编解码器,使用 512 状态的 Trellis 与 Viterbi 编码,在极低比特率(2-3 比特)下,与标准标量量化相比,能显著降低 KL 散度(误差)。
  • MoE 缓存:对于大型 MoE 模型(如 DeepSeek V4 Flash),它允许被路由的专家驻留在系统 RAM 中,同时将“热门”专家张量缓存在备用 VRAM 中以加速推理。
  • 视觉的 GPU 交换:为了节省 VRAM,它可以在处理图像时,暂时卸载推测性解码组件,以将视觉编码器(mmproj)加载到 GPU,然后再交换回来。

适用对象

在消费级 GPU(例如 RTX 3090)上处理大型模型的开发人员与研究人员,他们需要在不过度牺牲模型准确度的情况下,突破上下文窗口大小与推理速度的极限。

重点特色

  • 动态质量控制:VBR 允许缓存从 FP16 优雅地降级至 1.25 比特/值。
  • 高效能编解码器:TCQ 在 3.25 比特/值下提供接近 FP16 的困惑度。(perplexity)。
  • 自适应 MoE 管理:针对大型 MoE 模型的自动拟合与专家并行分派。
  • VRAM 优化:在视觉编码器与推测性解码辅助组件之间进行智能交换。

相关

  • Dispatch
  • 项目
  • 项目
  • Dispatch
  • Dispatch