通过约束二元优化进行块移除的 LLM 压缩

TL;DR

Hugging Face 宣布了一种剪枝技术,将 Transformer 块移除转化为 Ising 玻璃约束二元优化问题,实现了快速、高质量的深度压缩,并在 Llama-3.3-70B-Instruct 上以 50% 压缩率实现了高达 23 个百分点的 MMLU 提升。

为什么块选择是一个多体问题

现有的深度剪枝方法使用幅度或敏感性等启发式方法对单个块进行排序,将每个块视为独立(平均场近似)。实际上,移除一个块的影响取决于哪些其他块也被移除,从而产生类似于磁体中自旋相互作用的成对耦合。忽略这些耦合会丢弃有价值的信息,尤其是在剪除大量块时。

将块选择转化为能量最小化问题

  • 为每个 Transformer 块附加一个二元变量 (x_i)(0 = 保留,1 = 移除)。

  • 对模型损失关于 (x) 进行二阶泰勒展开,得到近似 Hessian 矩阵 (H)。

  • (H) 的对角项捕捉单个块的重要性;非对角项捕捉成对耦合。

  • 剪枝目标变为:

    [ \min_{x}; x^{\top} H^{0} x \quad \text{s.t.}; \sum_i x_i = M ]

    这是一个约束二元优化(CBO)问题,在数学上等同于寻找具有固定磁化强度(移除块的数量)的 Ising 玻璃的低能态。关键在于,低能构型与下游基准高分强烈相关,使得能量成为模型质量的廉价代理。

候选构型的高效评估

完整的 Hessian 矩阵通过在小规模校准数据集上的前向和反向传播计算一次。之后,评估任何块移除构型只需矩阵-向量乘法,无需完整的模型推理或基准评估。同一个 Hessian 矩阵可以重复用于不同的压缩目标 (M)。

解决优化问题

  • 精确暴力搜索:对于适度的构型空间(例如,在 Llama-3.3-70B 中移除 80 个块中的 8 个),在单个 GPU 上枚举数十亿个构型是可行的;最困难的情况大约需要 2 天。
  • 量子启发求解器:更大的空间通过将 CBO 转换为 QUBO(添加基数约束的惩罚项)并馈送给经典、量子或量子启发优化器(如禁忌搜索、量子退火和 QAOA)来处理。一个开源的禁忌求解器在最困难的验证实例上始终能在几秒内达到最低能态。
  • 实际目标:与其坚持全局基态,该流程提取低能态谱,以最小的额外成本提供多个高质量的剪枝候选。

低能谱的重要性

由于能量是一个不完美的代理,绝对基态并不总是最佳剪枝模型。通过采样几个低激发态,从业者可以获得多样化的构型集合。在 Llama-3.1-8B-Instruct 的实验中,第 17 激发态——移除早期块——在轻度重训练后优于基态,这反驳了最优剪枝总是移除连续后期层块的假设。

实证结果

模型 移除的块数 MMLU
Llama-3.3-70B-Instruct(原始) 0 82.2
CBO(我们的) 32 / 80 76.6
块影响(基线) 32 / 80 59.3
CBO(我们的) 40 / 80 76.9
块影响(基线) 40 / 80 54.0
  • 在 50% 深度压缩(移除 40/80 个块)下,CBO 保持约 77 的 MMLU,而最强的基线降至 50 多分。
  • 类似增益出现在 Qwen3-14B 上(移除 12/40 个块时约 10 个 MMLU 点)以及所有方法收敛的较轻压缩设置中。

对异构架构的泛化

Ising 公式不依赖于块的同质性;它只需要一个耦合矩阵。将 CBO 应用于 NVIDIA-Nemotron-3-Nano-30B-A3B-FP8——一种交错 Mamba2、注意力机制和 MoE 层的混合模型——产生的剪枝构型在 AIME25 和 GPQA 上无需重训练即可优于块影响基线。结果证实,不同专家层的冗余度不同,探索耦合构型空间可以发现最可丢弃的组件。

与 Multiverse Computing 技术栈的契合

将剪枝重新表述为 Ising Hamiltonian 利用了 Multiverse Computing 现有的经典和量子启发优化基础设施。块移除与其他压缩技术(量化、低秩 SVD、宽度剪枝、知识蒸馏修复)自然组合,形成统一流程而非竞争方法。

获取研究资源

Sources