ブロック削除による制約付き二値最適化を用いたLLMの圧縮

TL;DR

Hugging Faceは、Transformerブロックの削除をイジングガラス制約付き二値最適化問題として定式化するプルーニング手法を発表しました。これにより、高速かつ高品質な深さ圧縮が可能となり、Llama‑3.3‑70B‑Instructにおいて50 %の圧縮率でMMLUスコアが最大23ポイント向上しました。

ブロック選択が多体問題である理由

既存の深さプルーニング手法は、マグニチュードや感度といったヒューリスティックを用いて個々のブロックを順位付けし、各ブロックを独立して扱う(平均場近似)というアプローチを採用しています。実際には、あるブロックを削除する影響は、同時に削除される他のブロックに依存しており、磁石におけるスピン相互作用に類似したペアワイズ結合が生じます。これらの結合を無視すると、特に多数のブロックを削除する場合に、貴重な情報を失うことになります。

ブロック選択をエネルギー最小化問題に変換する

  • 各Transformerブロックに二値変数 (x_i) を割り当てる(0 = 保持、1 = 削除)。

  • モデル損失を (x) に関して2次テイラー展開し、近似ヘッセ行列 (H) を得る。

  • (H) の対角成分は個々のブロックの重要性を捉え、非対角成分はペアワイズ結合を捉える。

  • プルーニングの目的関数は以下の通りとなる:

    [ \min_{x}; x^{\top} H^{0} x \quad \text{s.t.}; \sum_i x_i = M ]

    これは制約付き二値最適化(CBO)問題であり、固定磁化(削除ブロック数)を持つイジングガラスの低エネルギー状態を求めるのと数学的に同一です。重要な点は、低エネルギー状態は高品質な下流ベンチマークスコアと強く相関しており、エネルギーはモデル品質の安価な代理指標となるということです。

候補構成の効率的な評価

完全なヘッセ行列は、小さなキャリブレーションデータセット上で前方・後方伝搬を1回行うことで計算される。その後、任意のブロック削除構成の評価には行列-ベクトル積のみが必要となり、モデルの完全な推論やベンチマーク評価の必要がなくなる。同じヘッセ行列は、異なる圧縮目標 (M) に対して再利用可能である。

最適化問題の解法

  • 正確なブルートフォース:比較的小さな構成空間(例:Llama‑3.3‑70Bで80ブロック中8ブロック削除)では、単一GPU上で数十億の構成を列挙することが可能。最も困難なケースでも約2日間で完了。
  • 量子インスパイアドソルバー:より大きな空間では、CBOをQUBOに変換(基数制約に対するペナルティを追加)し、古典的・量子的・量子インスパイアド最適化器(例:タブー探索、量子アニーリング、QAOA)に供給する。オープンソースのタブー探索ソルバーは、最も困難な検証済みインスタンスにおいて数秒で最低エネルギー状態に到達する。
  • 実用的な目標:グローバル基底状態を強制するのではなく、パイプラインは低エネルギー状態のスペクトルを抽出し、追加コストを最小限に抑えつつ、複数の高品質なプルーニング候補を提供する。

低エネルギースペクトルの重要性

エネルギーは不完全な代理指標であるため、絶対的な基底状態が常に最良のプルーニングモデルとは限らない。複数の低エネルギー励起状態をサンプリングすることで、多様な構成を得られる。Llama‑3.1‑8B‑Instructにおける実験では、17番目の励起状態(初期ブロックを削除)が軽い再訓練後に基底状態を上回り、最適なプルーニングが常に連続した後半層のブロックを削除するという仮定を否定した。

実証的結果

モデル 削除ブロック数 MMLU
Llama‑3.3‑70B‑Instruct(元のモデル) 0 82.2
CBO(本研究) 32 / 80 76.6
ブロック影響(ベースライン) 32 / 80 59.3
CBO(本研究) 40 / 80 76.9
ブロック影響(ベースライン) 40 / 80 54.0
  • 50 %の深さ圧縮(80ブロック中40ブロック削除)において、CBOはMMLU約77を維持する一方、最も強力なベースラインは中位の50台にまで低下する。
  • Qwen3‑14Bでも同様の向上が見られ(12/40ブロック削除で約10ポイントMMLU向上)、軽い圧縮設定ではすべての手法が収束する。

異種アーキテクチャへの一般化

イジング定式化はブロックの均一性に依存しない。結合行列さえあればよい。NVIDIA‑Nemotron‑3‑Nano‑30B‑A3B‑FP8—Mamba2、アテンション、MoE層を交互に配置したハイブリッドモデル—にCBOを適用した結果、再訓練なしでAIME25およびGPQAにおいてブロック影響ベースラインを上回るプルーニング構成が得られた。この結果は、専門家層間で冗長性が異なること、そして結合された構成空間を探索することで最も削除可能なコンポーネントが明らかになることを確認した。

Multiverse Computingのスタックとの整合性

プルーニングをイジングハミルトニアンとして再定式化することで、Multiverse Computingが既に保有する古典的および量子インスパイアド最適化インフラを活用できる。ブロック削除は、量子化、低ランクSVD、幅プルーニング、知識蒸留による修復といった他の圧縮技術と自然に組み合わせられ、競合するアプローチではなく、統合されたパイプラインを形成する。

研究へのアクセス

Sources