microsoft/TransformerCompression
For releasing code related to compression methods for transformers, accompanying our publications
解决的问题
它减小了Transformer网络和大语言模型(LLM)的尺寸和内存占用,而无需复杂的代码优化。这使得模型能够运行得更快、占用更少内存,同时尽可能保持性能。
工作原理
SliceGPT使用一种训练后稀疏化方案。它首先对每个Transformer层应用正交变换,使模型的行为保持不变。然后,基于特征值衰减,识别并“切掉”权重矩阵中重要性最低的行和列。这将大的权重矩阵替换为更小的稠密矩阵,从而有效降低模型的嵌入维度。
适用人群
面向希望压缩LLM以实现更高效部署的开发者和研究人员,尤其是使用Hugging Face Hub上的模型(如Llama-2、Llama-3、Phi-2和OPT)的用户。
亮点
- 训练后压缩:适用于现有模型,无需从头重新训练。
- 减少内存和加速:降低嵌入维度以实现更快的推理和更低的内存占用。
- 恢复微调:支持使用LoRA进行切片后的恢复微调(RFT),以恢复丢失的性能。
- 可扩展架构:提供框架(ModelAdapter和LayerAdapter),以支持新的Hugging Face模型类型。
相关
- 项目
- 项目
- 项目
- 项目