OpenAI 使用 GPT‑4 发布 GPT‑2 自动神经元解释数据集

TL;DR

OpenAI 引入了一条自动化流水线,利用 GPT‑4 为 GPT‑2 中的单个神经元编写并评估自然语言解释,并开源了完整的解释集合、评分、可视化工具以及代码。

方法概述

该方法对 GPT‑2 的 307,200 个神经元中的每一个执行三步操作:(1) 提示 GPT‑4 生成该神经元行为的简短描述;(2) 让 GPT‑4 生成反例并完善描述;(3) 使用 GPT‑4 自身的判断对最终解释进行评分。此流水线运行在 OpenAI API 上,旨在将可解释性工作扩展到拥有数十亿参数的模型。

关键发现

  • 解释质量随层级变化:在更大的模型的后期层,评分下降,表明更深层的神经元更难用简短文本描述捕捉。
  • 迭代细化提升评分:请求 GPT‑4 提供反例并修正解释,可提升平均质量。
  • 模型规模重要:更大的解释模型能够产生更高评分的解释,但即使是 GPT‑4 也不及人工标注者。
  • 激活函数影响可解释性:使用不同激活函数训练的 GPT‑2 变体在评分上有适度提升。
  • 数据集统计:超过 1,000 个神经元的评分达到至少 0.8,意味着 GPT‑4 认为这些解释覆盖了该神经元大部分最高激活行为。大多数高分神经元并不显著,但仍有许多有趣的神经元解释不足。

已发布资源

  • 解释数据集:每个 GPT‑2 神经元的自然语言解释及 GPT‑4 评分。
  • 神经元查看器:用于浏览解释和激活模式的交互式网页工具。
  • 代码库:解释与评分流水线的开源实现,可通过 OpenAI API 与公开模型兼容(GitHub: openai/automated-interpretability)。

局限性

  • 解释的简洁性:简短的文本描述可能无法捕捉多义或高度复杂的神经元行为。
  • 分析范围:该方法仅解释相对于输入文本的神经元激活,未涉及下游影响或电路层面的交互。
  • 相关性 vs. 因果性:解释描述的是观察到的相关性,可能在分布外输入上失效。
  • 计算成本:为每个神经元运行 GPT‑4 计算量巨大。

未来方向

OpenAI 旨在将该技术扩展至:

  • 为完整神经电路(包括注意力头)生成解释。
  • 生成更丰富的、可能是多句或结构化的描述,以捕捉多义性。
  • 自动化假设检验与迭代,模拟人类可解释性研究者的工作流程。
  • 将流水线应用于更大、更强的模型,以在部署前检测对齐和安全问题,如欺骗或偏见。

社区行动号召

发布的数据集和工具旨在激发以下研究:

  • 更高质量神经元解释的新算法。
  • 利用解释的可视化与分析方法。
  • 将自动解释与人工解释进行比较的基准。

“我们希望研究社区能够开发出生成更高评分解释的新技术,并提供更好的工具来使用解释探索 GPT‑2。” — OpenAI 研究团队


作者: Jan Leike, Jeffrey Wu, Steven Bills, William Saunders, Leo Gao, Henk Tillman, Daniel Mossing

Sources