从 GPT-4 中提取概念
OpenAI 引入了新的可扩展方法,将 GPT-4 的内部表征分解为 1600 万潜在可供人类解释的模式,称为“特征”。这项研究是理解大型语言模型(LLM)内部工作原理并通过可解释性提升 AI 安全性的重大一步。
神经网络可解释性的挑战
神经网络并非直接设计,而是通过设计训练它们的算法来实现。这导致了“黑箱”问题,即生成的网络难以分解为可识别的部分,使得对 AI 安全性的推理在本质上不同于对传统工程安全(如汽车安全)的推理。
要解释这些模型,研究人员必须找到神经计算的基本构件。困难主要体现在两个方面:
- 密集激活: 语言模型中的神经激活通常在每个输入上都会触发,并同时表示许多概念。
- 真实概念的稀疏性: 在任何给定的上下文中,只有极小比例的所有可能概念是相关的。
稀疏自编码器用于通过识别对特定输出重要的一小组特征,将密集的神经活动与人类更易理解的稀疏激活模式对齐,从而解决上述问题。
大规模自编码器训练与结果
OpenAI 开发了新方法,使稀疏自编码器能够在前沿 AI 模型上扩展到数千万特征。这种方法展示了平滑且可预测的扩展性,且相较于以往技术有更好的收益。
使用此方案,OpenAI 在 GPT-2 small 和 GPT-4 的激活上训练了自编码器。GPT-4 自编码器识别出 1600 万特征。为验证可解释性,OpenAI 通过分析这些特征激活的文档对其进行可视化。已识别的可解释特征示例包括:
- 人类不完美: 与人类或事物缺陷相关的短语。
- 价格上涨: 与经济变化相关的模式。
- X 与 Y: 数学或坐标相关的模式。
- 训练日志: 软件训练过程中的技术日志。
- 修辞性提问: 用于产生效果的语言结构。
- 代数环: 特定的数学概念。
- 谁/什么是多巴胺: 生物或化学概念。
当前局限性
尽管此研究是一个里程碑,OpenAI 仍指出了若干关键局限性:
- 可解释性缺口: 许多已发现的特征仍难以解释,缺乏明确模式或出现与其编码概念无关的虚假激活。
- 覆盖不完整: 稀疏自编码器未捕获模型的全部行为。将 GPT-4 激活通过自编码器后,性能相当于使用约 10 倍更少计算资源训练的模型。
- 计算规模: 完整映射前沿 LLM 中的概念可能需要扩展到数十亿甚至数万亿特征,这仍是一个挑战。
- 功能理解: 在模型的某一点识别特征仅是一步。仍需进一步研究以了解模型如何计算这些特征以及它们在下游的使用方式。
未来方向与开源贡献
OpenAI 旨在利用这些特征对前沿模型的语言模型行为进行实用的监控和引导。最终目标是通过可解释性提供对模型行为的强有力保证,提升对 AI 稳健性和安全性的信任。
为支持研究社区,OpenAI 已发布以下资源:
- 研究论文: 对实验和方法的详细说明。
- 代码: 用于使用自编码器的代码。
- 完整自编码器套件: 针对 GPT-2 small 的完整自编码器集合。
- 特征可视化工具: 用于探索 GPT-2 和 GPT-4 特征的工具。
Sources
- OriginalExtracting Concepts from GPT-4