BAIR가 소개하는 SPEX와 ProxySPEX: 확장 가능한 LLM 상호작용 탐색
BAIR는 SPEX (Spectral Explainer)와 ProxySPEX, 두 알고리즘을 소개했습니다. 이 알고리즘들은 대규모로 이전에는 계산적으로 불가능했던 수준에서 대형 언어 모델(LLM) 내의 영향력 있는 상호작용을 식별하도록 설계되었습니다. 신호 처리와 코딩 이론을 활용함으로써, 이러한 프레임워크는 연구자들이 단일 구성 요소를 격리하는 수준을 넘어 수천 개의 특징, 데이터 포인트 및 내부 구성 요소 전반에 걸친 모델 행동을 주도하는 복잡한 의존성을 이해할 수 있게 합니다.
규모에 따른 복잡성 도전
해석 가능성 연구는 일반적으로 세 가지 관점에 초점을 맞춥니다: 특징 기여도(입력 특징), 데이터 기여도(영향력 있는 학습 예시), 그리고 기계적 해석 가능성(내부 모델 구성 요소). 그러나 모델 행동은 드물게 고립된 구성 요소의 결과이며, 복잡한 상호작용에서 발생합니다.
구성 요소 수가 증가함에 따라 잠재적인 상호작용도 기하급수적으로 증가하여 전체 분석이 불가능해집니다. SPEX와 ProxySPEX는 영향력 있는 상호작용의 두 가지 구조적 특성을 활용하여 이를 해결합니다:
- 희소성: 실제로 모델 출력을 주도하는 상호작용은 비교적 적은 수에 불과합니다.
- 저차원성: 영향력 있는 상호작용은 일반적으로 소수의 특징만을 포함합니다.
상호작용 탐색을 희소 복구 문제로 재구성함으로써, SPEX는 전략적으로 선택된 절제(ablation)를 사용해 후보 상호작용을 결합하고, 디코딩 알고리즘을 적용해 결정의 구체적인 원인을 분리합니다.
ProxySPEX: 계층 구조를 통한 효율성 향상
ProxySPEX는 SPEX 프레임워크를 기반으로 세 번째 구조적 특성인 계층 구조를 식별합니다. 복잡한 머신러닝 모델에서 고차 상호작용이 중요하다면, 그 하위 차원의 부분집합도 중요할 가능성이 높습니다.
이 계층 구조를 활용함으로써, ProxySPEX는 10배 적은 절제만으로도 SPEX와 동등한 성능을 달성하여 해석 과정의 계산 비용을 크게 줄입니다.
특징 기여도 적용 사례
표준 특징 기여도가 개별 중요한 특징을 식별하는 반면, SPEX는 그들 간의 관계를 포착합니다. 이는 감성 분석에서 이중 부정과 같은 뉘앙스나 Retrieval-Augmented Generation(RAG) 작업에서 여러 문서의 합성을 이해하는 데 중요합니다.
충실도와 확장성
감성 분석 작업에서 SPEX는 높은 충실도를 유지합니다—복구된 기여도가 보지 못한 테스트 절제에서 모델 출력을 예측하는 정확도—컨텍스트가 수천 개의 특징으로 확장되더라도. LIME 및 Banzhaf와 같은 주변 접근법도 확장 가능하지만, 복잡한 상호작용을 포착하지 못해 충실도가 낮습니다.
사례 연구: 트롤리 문제
수정된 트롤리 문제를 분석했을 때, GPT-4o mini가 실패했으며(정답률 8%에 불과) 표준 SHAP 기여도는 "trolley"라는 단어를 오류의 주요 원인으로 식별했습니다. 그러나 "trolley"를 동의어로 교체해도 큰 효과가 없었습니다. SPEX는 "trolley"(두 번 등장), "pulling", "lever"라는 단어들 사이의 고차 시너지 효과를 밝혀냈습니다. 이 네 단어를 동의어로 교체하면 모델의 실패율이 거의 0에 가까워졌습니다.
데이터 기여도와 학습 데이터 영향
ProxySPEX는 학습 데이터 포인트가 어떻게 상호작용하여 예측에 영향을 미치는지 식별할 수 있습니다. 이를 통해 연구자는 두 종류의 상호작용을 구분할 수 있습니다:
- 시너지 상호작용: 의미적으로 구별되는 클래스가 결합하여 결정 경계를 정의합니다. 예를 들어, 자동차에 대한 예측은 스포츠카의 저프로파일 섀시, 트럭의 박스형 형태, 그리고 배달 차량의 가로 스트라이프 간의 시너지에 의해 좌우될 수 있습니다.
- 중복 상호작용: 특정 개념을 강화하는 시각적 중복으로, 예를 들어 유사한 실루엣을 가진 개 이미지 클러스터가 "horse" 예측에 영향을 미치는 경우입니다.
이 구분은 중복을 제거하고 필요한 시너지를 유지하는 데이터 선택 기법 개발을 가능하게 합니다.
기계적 해석 가능성과 어텐션 헤드 기여도
ProxySPEX는 어텐션 헤드와 같은 내부 모델 구성 요소 간의 상호작용을 식별할 수 있게 합니다.
구조적 개입
MMLU 데이터셋(highschool-us-history)에서, ProxySPEX에 기반한 프루닝 전략이 경쟁 방법들을 능가했으며 실제로 목표 작업에서 모델 성능을 향상시켰습니다.
깊이에 따른 상호작용 구조
모델 깊이 분석을 통해 구성 요소 간 상호작용의 변화를 확인했습니다:
- 초기 레이어: 어텐션 헤드가 독립적으로 기여하는 주로 선형적인 영역에서 작동합니다.
- 후기 레이어: 어텐션 헤드 간 상호작용이 더욱 두드러지며, 주로 동일 레이어 내 헤드들 사이에서 발생합니다.
구현 및 사용 가능성
SPEX와 ProxySPEX의 코드는 SHAP-IQ repository에 통합되어 있으며 https://github.com/mmschlk/shapiq에서 공개적으로 사용할 수 있습니다.