突破三元大模型 1.58 位限制

研究人员开发了一种名为 BITCOS 的新型权重存储布局,使得三元大语言模型(LLM)的存储效率能够超越 1.585 位/权重的理论信息论极限。通过利用三元权重中零值占比过高的特性,BITCOS 在最稀疏的模型中将有效位宽降低至 1.485 位/权重。

1.58 位壁垒与当前局限

三元 LLM 将权重存储为 $\text{−1}, 0, +1$ 三个符号之一。理论上的最小存储成本为 $\log_2 3 \approx 1.585$ 位/权重。在当前的生产部署中,主流格式是“五三进制打包”(five-trit packing),即将五个三元权重打包进一个字节。由于 2 的幂次分组限制,这导致实际存储的有效位宽为 1.625 位/权重。

这种现有方法将三个符号视为等概率分布,即假设每个符号的占比约为 33.3%。然而,研究人员测量了 29 种不同三元 LLM 模型的实际符号分布,发现零值在所有权重中占比高达 51.5%。

BITCOS:分布自适应布局

为了利用这种高零密度特性,研究人员引入了 BITCOS,这是一种分布自适应布局。BITCOS 不再使用固定位打包方案,而是采用两部分结构:

  1. 密集存在位图(Dense Presence Bitmap):一个用于指示权重是零还是非零的位图。
  2. 压缩符号向量(Compacted Sign Vector):一个仅存储非零权重符号的压缩向量。

BITCOS 的存储成本定义为每个权重元素 $2 - z$ 位,其中 $z$ 是模型权重中的零密度。随着零密度的增加,存储成本会随之降低。

性能与硬件优化

// a single section on performance metrics

在测试的 29 个模型中,BITCOS 在 26 个模型上的表现优于五三进制打包。在最稀疏的模型中,它达到了 1.485 位/权重的存储效率。作者为现代处理器和 GPU 提供了优化的解包序列,包括 AVX-512、AVX2 和 Intel Xe2 GPU。

与最先进的三元矩阵向量乘法内核相比,BITCOS 提供了以下增益:

  • 实际增益:矩阵向量乘法内核性能提升高达 1.28$imes$。
  • CPU 解码吞吐量:在客户端和服务器 CPU 上提升高达 1.18$imes$。
  • GPU 解码吞吐量:在 Intel Xe2 GPU 上提升高达 1.27$imes$。

社区见解与反方观点

Hacker News 上的技术用户讨论表明,这项研究对于 VRAM 和 RAM 限制严格的边缘计算和嵌入式系统尤为重要。

一位用户指出,虽然效率提升显著,但在该领域,向量量化或基于网格的后训练量化(PTQ)方法可能更有效。另一位用户建议,算术编码可能进一步压缩位数,尽管这可能会以更高的解压开销为代价。

"如果三元 LLM 能够成功并作为定制芯片集成到硬件中,我敢打赌它们将具备惊人的效率。"

"这可以大幅缩小嵌入式系统的 LLM 体积,使其真正实现便携化。"

实现细节

研究人员的发现表明,1.58 位限制仅适用于等概率符号的情况。通过将权重分布视为一种分布自适应布局,BITCOS 允许模型以一种可直接作为内存格式使用的形式进行存储,而不仅仅是作为存储或传输格式。

Sources

相关