突破三元大模型 1.58 位限制
研究人员开发了一种名为 BITCOS 的新型权重存储布局,使得三元大语言模型(LLM)的存储效率能够超越 1.585 位/权重的理论信息论极限。通过利用三元权重中零值占比过高的特性,BITCOS 在最稀疏的模型中将有效位宽降低至 1.485 位/权重。
1.58 位壁垒与当前局限
三元 LLM 将权重存储为 $\text{−1}, 0, +1$ 三个符号之一。理论上的最小存储成本为 $\log_2 3 \approx 1.585$ 位/权重。在当前的生产部署中,主流格式是“五三进制打包”(five-trit packing),即将五个三元权重打包进一个字节。由于 2 的幂次分组限制,这导致实际存储的有效位宽为 1.625 位/权重。
这种现有方法将三个符号视为等概率分布,即假设每个符号的占比约为 33.3%。然而,研究人员测量了 29 种不同三元 LLM 模型的实际符号分布,发现零值在所有权重中占比高达 51.5%。
BITCOS:分布自适应布局
为了利用这种高零密度特性,研究人员引入了 BITCOS,这是一种分布自适应布局。BITCOS 不再使用固定位打包方案,而是采用两部分结构:
- 密集存在位图(Dense Presence Bitmap):一个用于指示权重是零还是非零的位图。
- 压缩符号向量(Compacted Sign Vector):一个仅存储非零权重符号的压缩向量。
BITCOS 的存储成本定义为每个权重元素 $2 - z$ 位,其中 $z$ 是模型权重中的零密度。随着零密度的增加,存储成本会随之降低。
性能与硬件优化
// a single section on performance metrics
在测试的 29 个模型中,BITCOS 在 26 个模型上的表现优于五三进制打包。在最稀疏的模型中,它达到了 1.485 位/权重的存储效率。作者为现代处理器和 GPU 提供了优化的解包序列,包括 AVX-512、AVX2 和 Intel Xe2 GPU。
与最先进的三元矩阵向量乘法内核相比,BITCOS 提供了以下增益:
- 实际增益:矩阵向量乘法内核性能提升高达 1.28$imes$。
- CPU 解码吞吐量:在客户端和服务器 CPU 上提升高达 1.18$imes$。
- GPU 解码吞吐量:在 Intel Xe2 GPU 上提升高达 1.27$imes$。
社区见解与反方观点
Hacker News 上的技术用户讨论表明,这项研究对于 VRAM 和 RAM 限制严格的边缘计算和嵌入式系统尤为重要。
一位用户指出,虽然效率提升显著,但在该领域,向量量化或基于网格的后训练量化(PTQ)方法可能更有效。另一位用户建议,算术编码可能进一步压缩位数,尽管这可能会以更高的解压开销为代价。
"如果三元 LLM 能够成功并作为定制芯片集成到硬件中,我敢打赌它们将具备惊人的效率。"
"这可以大幅缩小嵌入式系统的 LLM 体积,使其真正实现便携化。"
实现细节
研究人员的发现表明,1.58 位限制仅适用于等概率符号的情况。通过将权重分布视为一种分布自适应布局,BITCOS 允许模型以一种可直接作为内存格式使用的形式进行存储,而不仅仅是作为存储或传输格式。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch