OpenAI 使用 GPT‑4 发布 GPT‑2 自动神经元解释数据集
TL;DR
OpenAI 引入了一条自动化流水线,利用 GPT‑4 为 GPT‑2 中的单个神经元编写并评估自然语言解释,并开源了完整的解释集合、评分、可视化工具以及代码。
方法概述
该方法对 GPT‑2 的 307,200 个神经元中的每一个执行三步操作:(1) 提示 GPT‑4 生成该神经元行为的简短描述;(2) 让 GPT‑4 生成反例并完善描述;(3) 使用 GPT‑4 自身的判断对最终解释进行评分。此流水线运行在 OpenAI API 上,旨在将可解释性工作扩展到拥有数十亿参数的模型。
关键发现
- 解释质量随层级变化:在更大的模型的后期层,评分下降,表明更深层的神经元更难用简短文本描述捕捉。
- 迭代细化提升评分:请求 GPT‑4 提供反例并修正解释,可提升平均质量。
- 模型规模重要:更大的解释模型能够产生更高评分的解释,但即使是 GPT‑4 也不及人工标注者。
- 激活函数影响可解释性:使用不同激活函数训练的 GPT‑2 变体在评分上有适度提升。
- 数据集统计:超过 1,000 个神经元的评分达到至少 0.8,意味着 GPT‑4 认为这些解释覆盖了该神经元大部分最高激活行为。大多数高分神经元并不显著,但仍有许多有趣的神经元解释不足。
已发布资源
- 解释数据集:每个 GPT‑2 神经元的自然语言解释及 GPT‑4 评分。
- 神经元查看器:用于浏览解释和激活模式的交互式网页工具。
- 代码库:解释与评分流水线的开源实现,可通过 OpenAI API 与公开模型兼容(GitHub:
openai/automated-interpretability)。
局限性
- 解释的简洁性:简短的文本描述可能无法捕捉多义或高度复杂的神经元行为。
- 分析范围:该方法仅解释相对于输入文本的神经元激活,未涉及下游影响或电路层面的交互。
- 相关性 vs. 因果性:解释描述的是观察到的相关性,可能在分布外输入上失效。
- 计算成本:为每个神经元运行 GPT‑4 计算量巨大。
未来方向
OpenAI 旨在将该技术扩展至:
- 为完整神经电路(包括注意力头)生成解释。
- 生成更丰富的、可能是多句或结构化的描述,以捕捉多义性。
- 自动化假设检验与迭代,模拟人类可解释性研究者的工作流程。
- 将流水线应用于更大、更强的模型,以在部署前检测对齐和安全问题,如欺骗或偏见。
社区行动号召
发布的数据集和工具旨在激发以下研究:
- 更高质量神经元解释的新算法。
- 利用解释的可视化与分析方法。
- 将自动解释与人工解释进行比较的基准。
“我们希望研究社区能够开发出生成更高评分解释的新技术,并提供更好的工具来使用解释探索 GPT‑2。” — OpenAI 研究团队
作者: Jan Leike, Jeffrey Wu, Steven Bills, William Saunders, Leo Gao, Henk Tillman, Daniel Mossing