BAIR 推出用于可扩展 LLM 交互发现的 SPEX 与 ProxySPEX
BAIR 推出了 SPEX(光谱解释器)和 ProxySPEX,这两种算法旨在在先前计算上不可行的规模上识别大型语言模型(LLM)中的影响交互。通过利用信号处理和编码理论,这些框架使研究人员能够超越对单一组件的孤立,进而理解在数千个特征、数据点和内部组件之间驱动模型行为的复杂依赖关系。
大规模复杂性的挑战
可解释性研究通常聚焦于三种视角:特征归因(输入特征)、数据归因(有影响的训练示例)和机制可解释性(内部模型组件)。然而,模型行为很少是孤立组件的结果;它源自复杂的交互。
随着组件数量的增加,潜在交互呈指数增长,使得穷尽分析变得不可能。SPEX 和 ProxySPEX 通过利用影响交互的两种结构特性来解决此问题:
- 稀疏性: 实际驱动模型输出的交互数量相对较少。
- 低阶性: 影响交互通常只涉及少量特征子集。
通过将交互发现重新表述为稀疏恢复问题,SPEX 使用策略性选择的消融来组合候选交互,然后采用解码算法来隔离决策的具体驱动因素。
ProxySPEX:通过层次结构提升效率
ProxySPEX 在 SPEX 框架的基础上识别出第三种结构特性:层次结构。在复杂的机器学习模型中,如果高阶交互重要,则其低阶子集也可能重要。
通过利用这种层次结构,ProxySPEX 在性能上与 SPEX 相匹配,但所需的消融约少 10 倍,显著降低了解释过程的计算成本。
特征归因的应用
虽然标准特征归因识别单个重要特征,SPEX 捕捉它们之间的关系。这对于理解情感分析中的双重否定或检索增强生成(RAG)任务中多个文档的合成等细微差别至关重要。
可信度与可扩展性
在情感分析任务中,SPEX 保持高 可信度——即恢复的归因在未见测试消融上预测模型输出的准确性——即使上下文扩展到数千个特征。虽然 LIME 和 Banzhaf 等边缘方法可以扩展,但它们的可信度较低,因为未能捕捉这些复杂交互。
案例研究:电车难题
在分析一个修改后的电车难题时,GPT-4o mini 表现不佳(仅 8% 的正确率),标准 SHAP 归因将单词 “trolley” 识别为错误的主要驱动因素。然而,将 “trolley” 替换为同义词影响甚微。SPEX 揭示了单词 “trolley”(出现两次)、“pulling” 与 “lever” 之间的高阶协同作用。将这四个特定单词替换为同义词后,模型的失败率降至几乎为零。
数据归因与训练集影响
ProxySPEX 能够识别训练数据点之间如何交互以影响预测。这使研究人员能够区分两种交互类型:
- 协同交互: 语义上不同的类别共同作用以定义决策边界。例如,对一辆汽车的预测可能由跑车的低矮底盘、卡车的方形外形以及送货车的水平条纹之间的协同驱动。
- 冗余交互: 视觉上重复的样本强化特定概念,例如一组具有相似轮廓的狗图像影响了对 “horse” 的预测。
这种区分促使开发能够去除冗余而保留必要协同的数据选择技术。
机制可解释性与注意力头归因
ProxySPEX 允许识别内部模型组件之间的交互,例如注意力头。
架构干预
在 MMLU 数据集(highschool-us-history)上,基于 ProxySPEX 的剪枝策略优于其他方法,甚至提升了模型在目标任务上的表现。
跨层深度的交互结构
对模型深度的分析揭示了组件交互方式的转变:
- 早期层: 主要在近线性 regime 中运行,注意力头独立贡献。
- 后期层: 注意力头之间的交互更为显著,主要发生在同一层内的头之间。
实现与可用性
SPEX 和 ProxySPEX 的代码已集成到 SHAP-IQ 仓库,并可在 https://github.com/mmschlk/shapiq 公共使用。