CLIP 中的多模态神经元
OpenAI 在 CLIP 模型中发现了“多模态神经元”,无论概念是以写实图像、素描还是文本形式呈现,这些神经元都会对其做出响应。这一发现表明 CLIP 利用了一种类似于人类大脑的抽象机制,解释了其对同一物体的不同视觉呈现进行分类的能力。
多模态神经元与语义不变性
CLIP 包含对语义概念簇而非特定视觉特征做出响应的神经元。这反映了生物学发现,例如人类大脑中的“Halle Berry”神经元,它会对照片、素描以及该女演员的名字文本产生反应。
在 CLIP 中,OpenAI 识别出了一个“Spider-Man”神经元(CLIP RN50x4 倒数第二层的 Neuron 244)会对以下内容激活:
- Spider-Man 穿着制服的写实图像。
- 真实蜘蛛的图像。
- Spider-Man 的漫画插图。
- 文本“spider”。
通过使用特征可视化和数据集示例,研究人员发现 CLIP RN50x4 中的大多数神经元都是可解释的,并作为“多面神经元”发挥作用,在高度抽象的层面上对多个不同的案例做出响应。这些神经元包括针对情绪、动物、名人、艺术风格甚至数字修改的神经元。
组合与分类
CLIP 通过组合这些高层级多模态神经元来进行分类。一个稀疏线性探针(sparse linear probe)显示,最终的分类往往是结合了几个概念神经元的结果。
- 视觉组合: “piggy bank”(存钱罐)的分类是通过结合“finance”(金融)神经元和“porcelain”(瓷器)神经元实现的。类似地,“Spider-Man”神经元有助于“barn spider”的分类。
- 文本组合: 对于语言,概念的行为几乎是线性的。例如,模型将“surprised”一词解释为“shock”和“celebration/hug”的组合。
然而,这种还原论的方法可能会导致遗漏。模型对“intimate”(亲密)的理解涉及“soft smile”和“hearts”,但明确地减去了“illness”(疾病),因此无法解释在患病背景下的亲密关系。
“缺失概念”问题
并非 CLIP 的所有能力都由单个、可解释的神经元表示。虽然 CLIP 可以进行精确的地理定位(精确到旧金山的“Twin Peaks”等特定社区),但研究人员无法找到特定的“San Francisco”神经元。这表明某些信息是以方向或复杂的流形(manifold)形式编码的,而不是离散的神经元。
脆弱性:排版攻击
模型对高层级抽象的依赖创造了一种新的攻击向量,称为“排版攻击”(typographic attacks)。由于 CLIP 的多模态神经元在字面和图标表示之间具有泛化能力,它们可以被触发于文本图像。
例如,“finance”神经元会对存钱罐和文本“$$$"做出响应。通过在标准贵宾犬(Standard Poodle)的图像中添加字符串“$$$",模型可能会被误导,将该狗分类为存钱罐。这些攻击是切实可行的,可以通过在物理对象上书写文本来执行。
偏见与过度泛化
CLIP 从其互联网规模的训练数据中继承了偏见,这些偏见在神经元中表现为问题性的关联:
- 地域偏见: “Middle East”神经元与恐怖主义相关联,而“immigration”神经元对拉丁美洲做出响应。
- 表征性伤害: 研究发现一个神经元会对大猩猩和深色皮肤的人同时产生反应。
- 分辨率差异: 美国和印度等国家的神经元定义明确,而非洲国家的神经元往往会对整个区域而非特定国家产生反应。
OpenAI 建议,对于从业者来说,可解释性工具对于在部署前预判这些偏见至关重要,,因为这些偏见可能很难通过标准测试来预测或衡量。
研究工具与模型发布
为了促进对多模态系统的进一步研究,OpenAI 发布了 CLIP RN50x4 和 RN101 的权重。此外,OpenAI Microscope 目录已更新,包含了 CLIP RN50x4 中每个神经元的特征可视化、数据集示例和文本特征可视化。