Google DeepMind 视觉对齐研究
谷歌DeepMind提出了一种方法,将AI视觉表示与人类概念层次对齐,减少模型依赖表层特征的倾向,提高其泛化能力。此研究表明,重组模型的内部视觉世界地图使系统更健壮、可靠,并在少样本学习等任务中表现更佳。
AI与人类视觉之间的错位
AI视觉模型常常无法通过与人类相同的概念视角来感知世界。虽然人类以层次方式组织视觉信息——认识到汽车和飞机都是大型金属车辆——AI模型经常关注背景颜色或纹理等表层特征。
为了量化这一差距,研究人员使用了认知科学中的“奇异一出”任务,其中受试者必须识别三张图片中哪一张不符合。研究结果揭示了一种系统性错位:在人类对答案高度一致的情况下,AI模型经常选择错误,因为它们优先考虑低层次视觉模式而非高层次概念类别。
视觉表示的三步对齐方法
直接在人类判断数据集上微调模型往往会导致过拟合,因为数据集太小。为克服这一点,谷歌DeepMind开发了一种三步流程,以在不丢失先验知识的情况下重构模型表示:
- 教师模型创建:在预训练视觉模型(SigLIP-SO400M)之上使用THINGS数据集训练了一个小型适配器。通过冻结主模型并对适配器进行正则化,研究人员创建了一个“教师”模型,该模型模拟类似人类的判断,而不会忘记其原始训练。
- 合成数据集生成:该教师模型用于生成AligNet,这是一个包含一百万张不同图像上数百万个类似人类的“奇异一出”决定的巨大数据集。
- 学生模型微调:其他AI模型(“学生”)使用AligNet数据集进行微调。该数据的多样性防止了过拟合,并使学生能够深度重构其内部表示映射。
因此,学生模型的内部映射从无结构的杂乱转变为有组织的簇,其中高层次概念(例如,动物 vs. 食物)被清晰分离。
对模型性能和可靠性的影响
将AI表示与人类概念层次对齐,在认知和技术性能方面都带来了可衡量的改进:
改进的人类对齐
对齐后的模型在“奇异一出”任务和多重排列任务(按相似度排列图像)上与人类判断的一致性显著提高。研究人员还引入了一个名为Levels的新数据集,以进一步验证这些改进。
人类般的不确定性
对齐后的模型发展出了一种与人类行为相关的不确定性形式;具体来说,模型决策不确定性与人类做出选择所需的时间强烈相关。
增强的泛化能力和鲁棒性
使模型更符合人类提高了它们在标准AI基准上的表现,包括:
- 少样本学习:从单张图像学习新类别的能力。
- 分布偏移:即使测试图像的类型发生变化,也能做出可靠决策的能力。
结论
通过重组视觉模型的内部表示映射以遵循人类概念层次,谷歌DeepMind表明AI可以变得更直观和可信。此方法提供了一条可扩展的路径,用于构建对表层噪声更鲁棒且能够在多样化视觉环境中更好泛化的视觉系统。