OpenAI 通过教学实现可解释的机器学习

OpenAI 已开发出一种机器教学方法,通过创建用于概念识别的人类可解释语言,使计算机和人类能够协作。该方法利用教师网络和学生网络之间的合作博弈来识别最小的一组说明性示例,这些示例使学生能够正确猜出目标概念。

教师-学生框架

此方法的核心是一个合作博弈,教师网络选择示例以帮助学生网络猜测特定概念(例如“狗”或“斑马”)。目标是让教师学会选择尽可能具说明性的示例,以促进学生的理解。

两阶段训练过程

为了确保得到的示例对人类仍然可解释,OpenAI 采用了一种两阶段技术:

  1. 学生训练:学生神经网络首先在随机选择的输入示例上使用传统的监督学习方法进行训练,以猜测正确的概念标签。
  2. 教师优化:教师网络具有将概念与示例关联的标签的访问权限,在学生上测试各种示例。教师收敛于学生正确识别目标概念所需的最小示例集。

通过分离训练阶段,此方法防止两个网络发展出一种私人的、非人类可解释的语言。在联合训练中——学生和教师同时进行训练——网络经常通过任意向量或对人类毫无意义的示例进行串通以进行交流。例如,概念“狗”可能通过羊驼和摩托车的图像进行编码,或者矩形的尺寸可能通过两个看起来随机的点进行编码。

实际应用:概念识别

为了展示该技术的有效性,OpenAI 研究人员使用了基于四个属性变化的示例:大小(小、中、大)、颜色(红、蓝、绿)、形状(方形 vs 圆形)和边框(实线 vs 无)。

在此情况下,概念被定义为定义一个示例子集的一组属性。教师网络学会选择仅共享概念所需属性的示例,使学生能够排除无关属性。

示例:教授“红色”概念

为了教学生识别“红色”概念,教师选择了两个具体的示例:一个无边框的大红色正方形和一个有边框的小红色圆形。由于这两个形状之间唯一的共同属性是颜色红色,学生可以逻辑地得出结论:该概念由颜色红色定义。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch