突破三元大型語言模型 (LLM) 的 1.58 位元障礙
研究人員開發了一種名為 BITCOS 的新型權重儲存佈局,該佈局允許三元大型語言模型 (LLM) 的儲存比理論上的資訊理論極限(每個權重 1.585 位元)更為緊湊。透過利用三元權重中零值比例過高的特性,BITCOS 在最稀疏的模型中將有效位元寬度降低至每個權重 1.485 位元。
1.58 位元障礙與當前限制
三元 LLM 將權重儲存為三個符號之一:$\text{−1}, 0, +1$。理論上的最小儲存成本為 $\log_2 3 \approx 1.585$ 位元/權重。在目前的生產部署中,主流格式是「五三元組打包」(five-trit packing),即將五個三元權重打包成一個位元組。由於二的冪次分組大小,這導致每個權重的有效儲存位元寬度為 1.625 位元。
這種現有的方法將這三個符號視為等機率,假設每個符號的分佈大約為 33.3%。然而,研究人員測量了 29 種不同三元 LLM 模型的實際符號分佈,發現零值佔所有權重的比例高達 51.5%。
BITCOS:分佈自適應佈局
為了利用這種高零密度,研究人員引入了 BITCOS,這是一種分佈自適應佈局。BITCOS 不使用固定位元打包方案,而是採用兩部分結構:
- 密集存在點陣圖 (Dense Presence Bitmap):一個點陣圖,用於指示權重是零還是非零。
- 壓縮符號向量 (Compacted Sign Vector):一個僅儲存非零權重符號的壓縮向量。
BITCOS 的儲存成本定義為每個權重元素 $2 - z$ 位元,其中 $z$ 是模型權重中的零密度。隨著零密度的增加,儲存成本會降低。
效能與硬體最佳化
// a single section on performance metrics
BITCOS 在 29 個測試模型中的 26 個模型表現優於五三元組打包。在最稀疏的模型中,它達到了每個權重 1.485 位元的儲存效率。作者為現代處理器和 GPU 提供了最佳化的解包序列,包括 AVX-512、AVX2 和 Intel Xe2 GPU。
與最先進的三元矩陣向量乘法核心相比,BITCOS 提供了以下增益:
- 實際增益:矩陣向量乘法核心效能提升高達 1.28$ \times$。
- CPU 解碼吞吐量:客戶端和伺服器 CPU 效能提升高達 1.18$ \times$。
- GPU 解碼吞吐量:Intel Xe2 GPU 效能提升高達 1.27$ \times$。
社群見解與反面觀點
Hacker News 上的技術使用者討論指出,這項研究對於 VRAM 和 RAM 限制嚴格的邊緣運算和嵌入式系統特別相關。
一位使用者指出,雖然效率提升顯著,但在該領域中,針對訓練後量化 (PTQ) 的向量量化或基於網格的方法可能更有效。另一位使用者建議,算術編碼可能可以擠出更多的位元,儘管這可能會以更高的解壓縮開銷為代價。
"如果三元 LLM 成功並被整合進客製化矽晶片的硬體中,我敢打賭它們將會非常高效。"
"這可以大幅縮減嵌入式系統的 LLM,使它們真正具備可攜性。"
實作細節
研究人員的發現表明,1.58 位元的限制僅適用於等機率符號。透過將權重分佈視為分佈自適應佈局,BITCOS 允許模型以一種可直接作為記憶體內格式使用的格式進行儲存,而不僅僅是作為儲存或傳輸格式。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch