BAIR 介紹 SPEX 與 ProxySPEX 用於可擴展的 LLM 互動發現
BAIR 已推出 SPEX(Spectral Explainer)與 ProxySPEX,兩種演算法旨在於先前計算上不可行的規模下,辨識大型語言模型(LLM)中的具影響力互動。透過訊號處理與編碼理論,這些框架讓研究者得以超越僅孤立單一元件的做法,進而理解驅動模型行為的千餘特徵、資料點與內部元件之間的複雜相依性。
大規模複雜性的挑戰
可解釋性研究通常聚焦於三個視角:feature attribution(輸入特徵)、data attribution(具影響力的訓練範例)與mechanistic interpretability(內部模型元件)。然而,模型行為很少是孤立元件的結果;它是由複雜互動所產生的。
隨著元件數量增加,潛在的互動呈指數成長,使得窮舉分析變得不可能。SPEX 與 ProxySPEX 透過利用具影響力互動的兩個結構性特徵來解決此問題:
- 稀疏性(Sparsity):實際驅動模型輸出的互動數量相對較少。
- 低階性(Low‑degreeness):具影響力的互動通常只涉及少數特徵。
透過將互動發現重新構築為稀疏恢復問題,SPEX 使用策略性選取的消融(ablation)將候選互動組合,接著運用解碼演算法分離出決策的具體驅動因素。
ProxySPEX:透過階層結構提升效率
ProxySPEX 在 SPEX 框架之上再加入第三個結構性特徵:階層性(hierarchy)。在複雜的機器學習模型中,若較高階的互動重要,其較低階的子集合也往往同樣重要。
藉由利用此階層結構,ProxySPEX 能在效能與 SPEX 相當的情況下,僅需約 10 倍更少的消融,大幅降低可解釋性流程的計算成本。
在特徵歸因中的應用
標準的特徵歸因僅辨識個別重要特徵,SPEX 則捕捉它們之間的關係。這對於理解諸如情感分析中的雙重否定,或檢索增強生成(RAG)任務中多篇文件的合成等細節至關重要。
真實性與可擴展性
在情感分析任務中,SPEX 保持高度 faithfulness——即在未見測試消融上,恢復的歸因能準確預測模型輸出,即使上下文擴展至數千特徵。雖然 LIME 與 Banzhaf 等邊緣方法能夠擴展,但因未捕捉到這些複雜互動,其真實性較低。
案例研究:電車問題
在分析一個 GPT‑4o mini 表現不佳的改編電車問題(正確率僅 8%)時,標準 SHAP 歸因指出「trolley」一詞是錯誤的主要驅動因素。然而,將「trolley」換成同義詞影響甚微。SPEX 揭示了「trolley」兩次出現、以及「pulling」與「lever」之間的高階協同作用。將這四個特定詞彙替換為同義詞後,模型的失敗率幾乎降至零。
資料歸因與訓練集影響
ProxySPEX 能辨識訓練資料點之間如何互動以影響預測。這讓研究者能區分兩種互動類型:
- 協同互動(Synergistic Interactions):語意上不同的類別共同作用以定義決策邊界。例如,對於一輛汽車的預測可能由跑車的低矮車身、卡車的方形外形與送貨車的水平條紋之協同所驅動。
- 冗餘互動(Redundant Interactions):視覺上相似的重複樣本加強特定概念,例如一群外形相似的狗圖像影響「馬」的預測。
此區分有助於開發資料選取技術,去除冗餘同時保留必要的協同效應。
機制可解釋性與注意力頭歸因
ProxySPEX 允許辨識內部模型元件(如注意力頭)之間的互動。
架構性干預
在 MMLU 資料集(highschool‑us‑history)上,基於 ProxySPEX 的剪枝策略優於其他方法,且實際提升了模型在目標任務上的表現。
深度層次的互動結構
對模型深度的分析顯示元件互動方式的轉變:
- 早期層(Early Layers):主要呈線性狀態,注意力頭獨立貢獻。
- 後期層(Later Layers):注意力頭之間的互動更為顯著,主要發生在同一層內的頭之間。
實作與可取得性
SPEX 與 ProxySPEX 的程式碼已整合至 SHAP‑IQ repository,可於 https://github.com/mmschlk/shapiq 公開取得。