OpenAI Activation Atlases
OpenAI 与 Google 研究人员合作,开发了 Activation Atlases,这是一种用于可视化神经网络中神经元之间相互作用的技术。这种方法允许研究人员超越对单个神经元的学习,转而理解多个神经元的联合表示空间,从而提供了一种窥探 AI 决策“黑盒”的方法。
Mapping Neural Interactions
Activation atlases 扩展了现有的特征可视化技术。早期的工作主要关注单个神经元代表什么,而 activation atlases 则收集并可视化成千上万个神经元相互作用的示例。这种转变使得可视化这些神经元共同表示的共享空间成为可能,从而为网络的内部表示提供更全面的视图。
Improving AI Auditability and Safety
理解神经网络的内部机制对于审计模型并确保高风险部署中的安全性至关重要。与传统的软件不同,开发者可以审查代码路径或进行形式化验证,神经网络缺乏类似的透明度。Activation atlases 通过允许人类识别以下内容来解决这个问题:
- Spurious Correlations: 识别网络依赖非因果相关性来对图像进行分类的实例。
- Feature Overloading: 发现单个特征在两个不同类别中重复使用如何导致错误。
- Model Vulnerabilities: 使人类能够基于对内部逻辑的理解来设计攻击以欺骗模型。
Case Study: Frying Pans vs. Woks
为了展示 activation atlases 的效用,研究人员创建了一个特定的 atlas 来分析网络如何区分煎锅(frying pans)与炒锅(woks)。分析显示,虽然网络正确识别了物理差异(例如煎锅呈方形,而炒锅更圆且更深),但它也依赖于一种虚假相关性:面条的存在。
研究人员发现,在图像角落添加面条可以使模型在 45% 的情况下将物体误分类为炒锅。其他针对特征检测器过载的人类设计的攻击甚至更有效,成功率高达 93%。这个例子突显了模型如何捕捉非因果的相关性,这种模式反映了对 AI 系统中公平性和偏见问题的担忧。
Implications for Interpretability
Activation atlases 的成功表明,神经网络的激活值对人类来说是有意义的。这一发现增加了人们对视觉模型实现强大可解释性的乐观情绪,有望使 AI 系统从不透明的“黑盒”转向透明、可审计的系统。
Sources
- OriginalIntroducing Activation Atlases