제약 이진 최적화를 통한 블록 제거 기반 LLM 압축

TL;DR

Hugging Face는 트랜스포머 블록 제거를 Ising 유리 제약 이진 최적화 문제로 변환하는 프루닝 기법을 발표했습니다. 이 기법은 빠르고 고품질의 깊이 압축을 가능하게 하며, Llama-3.3-70B-Instruct에서 50% 압축 시 MMLU 최대 23포인트 향상을 제공합니다.

블록 선택이 다체 문제인 이유

기존 깊이 프루닝 방법은 크기 또는 민감도와 같은 휴리스틱을 사용하여 개별 블록을 독립적으로 취급합니다(평균장 근사). 실제로 블록 제거의 영향은 다른 블록도 제거되는지에 따라 달라지며, 이는 자석의 스핀 상호작용과 유사한 쌍별 결합을 생성합니다. 이러한 결합을 무시하면 특히 많은 수의 블록이 프루닝될 때 귀중한 정보가 손실됩니다.

블록 선택을 에너지 최소화 문제로 전환

  • 각 트랜스포머 블록에 이진 변수 (x_i)를 할당합니다(0 = 유지, 1 = 제거).

  • 모델 손실을 (x)에 대해 2차 테일러 전개하여 근사 헤시안 (H)를 얻습니다.

  • (H)의 대각선 항목은 개별 블록 중요도를, 비대각선 항목은 쌍별 결합을 포착합니다.

  • 프루닝 목적 함수는 다음과 같아집니다:

    [ \min_{x}; x^{\top} H^{0} x \quad \text{s.t.}; \sum_i x_i = M ]

    이는 제약 이진 최적화(CBO) 문제로, 고정된 자화(제거된 블록 수)를 가진 Ising 유리의 저에너지 상태를 찾는 것과 수학적으로 동일합니다. 중요한 점은 저에너지 구성이 높은 다운스트림 벤치마크 점수와 강하게 상관관계가 있어 에너지가 모델 품질의 저렴한 대리 지표가 된다는 것입니다.

후보 구성의 효율적 평가

전체 헤시안은 소규모 보정 데이터셋에 대한 순전파 및 역전파에서 한 번 계산됩니다. 이후에는 블록 제거 구성을 평가하는 데 행렬-벡터 곱셈만 필요하므로 전체 모델 추론이나 벤치마크 평가가 필요 없습니다. 동일한 헤시안은 다른 압축 목표 (M)에 재사용할 수 있습니다.

최적화 문제 해결

  • 정확한 무차별 대입: 적당한 구성 공간(예: Llama-3.3-70B에서 80개 중 8개 블록 제거)의 경우 단일 GPU에서 수십억 개의 구성을 열거하는 것이 가능하며, 가장 어려운 경우는 약 2일이 걸렸습니다.
  • 양자 영감 솔버: 더 큰 공간은 CBO를 QUBO로 변환(카디널리티 제약에 페널티 추가)하고 이를 금지 검색, 양자 어닐링, QAOA와 같은 고전적, 양자 또는 양자 영감 최적화 도구에 공급하여 처리합니다. 오픈 소스 금지 솔버는 가장 어려운 검증된 인스턴스에서 수초 내에 일관되게 최저 에너지 상태에 도달합니다.
  • 실용적 목표: 절대적 최저 에너지 상태를 고집하는 대신, 파이프라인은 저에너지 상태의 스펙트럼을 추출하여 최소한의 추가 비용으로 여러 고품질 프루닝 후보를 제공합니다.

저에너지 스펙트럼의 중요성

에너지는 불완전한 대리 지표이므로 절대 최저 에너지 상태가 항상 최상의 프루닝 모델은 아닙니다. 여러 저에너지 여기 상태를 샘플링함으로써 실무자는 다양한 구성 세트를 얻을 수 있습니다. Llama-3.1-8B-Instruct 실험에서 17번째 여기 상태(초기 블록 제거)는 가벼운 재훈련 후 최저 에너지 상태보다 성능이 뛰어나, 최적 프루닝이 항상 연속적인 후기 레이어 청크를 제거한다는 가정을 반증했습니다.

실증 결과

모델 제거된 블록 MMLU
Llama-3.3-70B-Instruct (원본) 0 82.2
CBO (우리 방법) 32 / 80 76.6
블록 영향 (기준) 32 / 80 59.3
CBO (우리 방법) 40 / 80 76.9
블록 영향 (기준) 40 / 80 54.0
  • 50% 깊이 압축(80개 중 40개 블록 제거)에서 CBO는 MMLU 약 77을 유지하는 반면, 가장 강력한 기준선은 50대 중반으로 떨어집니다.
  • 유사한 개선이 Qwen3-14B(12/40 블록 제거 시 약 10 MMLU 포인트) 및 모든 방법이 수렴하는 더 가벼운 압축 설정에서도 나타납니다.

이기종 아키텍처로의 일반화

Ising 공식은 블록 동질성에 의존하지 않으며 결합 행렬만 필요합니다. CBO를 NVIDIA-Nemotron-3-Nano-30B-A3B-FP8(Mamba2, attention, MoE 레이어를 혼합한 하이브리드 모델)에 적용한 결과, 재훈련 없이 AIME25 및 GPQA에서 블록 영향 기준선보다 우수한 프루닝 구성을 생성했습니다. 결과는 전문가 레이어마다 중복성이 다르며, 결합 구성 공간을 탐색하면 가장 제거 가능한 구성 요소를 발견할 수 있음을 확인합니다.

Multiverse Computing 스택과의 적합성

프루닝을 Ising 해밀토니안으로 재구성하면 Multiverse Computing의 기존 고전 및 양자 영감 최적화 인프라를 활용할 수 있습니다. 블록 제거는 다른 압축 기법(양자화, 저랭크 SVD, 너비 프루닝, 지식 증류 힐링)과 자연스럽게 결합되어 경쟁적 접근 방식이 아닌 통합 파이프라인을 형성합니다.

연구 접근

Sources