facebookresearch/LayerSkip

Code for "LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding", ACL 2024

解决的问题

LayerSkip 解决了大语言模型(LLM)推理中的计算成本和延迟问题。它通过允许模型在生成的草稿阶段从深层的网络层中“提前退出”,从而减少每个 token 生成所需的计算量,实现更快的 token 生成。

工作原理

LayerSkip 使用一种训练方法,使单个模型既能充当草稿模型,也能充当验证模型。它实现了自我推测性解码,模型在指定层(exit_layer)退出,快速生成草稿 token。这些 token 随后由完整模型一次性验证,相比标准的自回归解码显著提升了速度。

适用人群

本项目适用于希望在不牺牲正确性的前提下提升 Llama 基础模型推理速度的 AI 研究人员和开发者,尤其适用于摘要和代码生成等生成任务。

主要亮点

  • 自我推测性解码:使用同一模型进行草稿和验证,无需额外的小型草稿模型。
  • 提前退出推理:用户可指定退出层,以在速度与准确率之间取得平衡。
  • 广泛模型支持:提供多种 Llama 2、Llama 3、Llama 3.2 和 CodeLlama 模型的预训练检查点。
  • 集成支持:已集成至 Hugging Face transformers 和 PyTorch torchtune
  • 评估工具:包含用于基准测试、正确性验证和超参数调优的脚本,以找到最优的退出层和推测次数。

相关

  • Dispatch
  • 项目
  • 项目
  • Dispatch
  • 项目