OpenAI 通过稀疏电路理解神经网络
OpenAI 通过训练高度稀疏的语言模型(将大多数权重强制设为零)提出了一种改进机制可解释性的研究方法。该方法生成的模型包含小型、解耦的“电路”,这些电路既易于理解,又足以执行特定的算法任务,这表明了一条可扩展的路径,以理解更大 AI 系统的内部计算。
机制可解释性 vs. 思维链
OpenAI 区分了理解模型输出的两种主要方法:
- 思维链可解释性: 这利用了推理模型在其过程中生成的解释来监控行为。虽然对于检测欺骗等问题很有用,但 OpenAI 指出这是一种“脆弱策略”,可能会随着时间的推移而失效。
- 机制可解释性: 这种方法旨在在最细粒度水平上完全逆向工程模型的计算。虽然实施起来更困难,但它假设更少,并对模型行为的解释提供了更高的置信度。 可解释性被视为一个关键的安全组件,它能够实现更好的监督,并提供战略性错位或不安全行为的早期警告信号,以补充对抗训练和红队演练。
学习稀疏模型以实现解耦
传统神经网络是密集且纠缠的,每个神经元连接到数千个其他神经元,并且通常执行多种不同的功能。为了解决这个问题,OpenAI 在特定约束下训练语言模型(类似 GPT-2 架构):模型的绝大多数权重被强制设为零。 通过将每个神经元的连接数限制为几十个,研究人员旨在解耦模型的内部计算。从密集到稀疏连接的这一转变旨在使神经元和整体网络架构对人类来说更易于解读。
通过电路评估可解释性
为了衡量此方法的成功,OpenAI 隔离了“电路”——模型中负责特定行为的最小部分。研究发现,训练更大且更稀疏的模型可以创建能力越来越强的模型,同时保持简单且可解释的电路。
案例研究:Python 引号补全
在要求模型用正确匹配的引号(单引号 vs. 双引号)完成字符串的任务中,稀疏模型实现了一个特定的、解耦的算法:
- 编码: 单引号和双引号在独立的残差通道中进行编码。
- 分类: MLP 层将这些转换为一个检测任何引号的通道和一个分类引号类型的通道。
- 注意力: 注意力操作忽略干扰标记以找到前一个引号并将其类型复制到最终标记。
- 预测: 模型预测匹配的闭合引号。 此电路仅由五个残差通道、第 0 层的两个 MLP 神经元以及第 10 层的一个注意力查询-键通道和一个值通道组成。这些连接既是充分的(如果移除模型的其余部分,任务仍可执行),也是必要的(删除这些边会导致模型失败)。
复杂行为和变量绑定
对于更复杂的任务,例如变量绑定,这些电路更难完全解释。然而,研究人员仍然能够获得能够预测模型行为的部分解释。例如,在变量绑定中,一个注意力操作在定义过程中将变量名复制到一个 set() 标记中,而后来的另一个操作则从 set() 标记中复制类型到变量的后续使用。
未来方向和可扩展性
尽管这些稀疏模型比前沿模型小得多,但 OpenAI 确定了两条主要路径来扩展这些发现:
- 提取: 从现有的密集模型中提取稀疏电路,这更高效地部署。
- 训练效率: 开发更高效的技术来专门为可解释性训练模型,使其投入生产。 OpenAI 指出,虽然这些结果对简单行为很有希望,但该方法不一定能扩展到最强大的系统,但目标是构建工具,使未来的 AI 系统更易于分析、调试和评估。