OpenAI 学者 2019 年最终项目

OpenAI 展示了 2019 年 OpenAI 学者项目的最终成果,展示了来自不同学术和专业背景的个人如何应用深度学习和强化学习来解决复杂问题。这些项目涵盖自然语言处理、机器人操作、医疗治疗优化和模型可解释性。

自然语言处理与理解

几位学者专注于基于 transformer 的语言模型在特定任务上的应用和优化。

微调 GPT-2 用于问答

Fatma Tarlaci 尝试对 GPT-2 小模型进行微调,以适用于问答(QA)任务。该项目旨在分析模型的推理机制,因为问答需要语言处理和推理技能的结合。

变换器的知识蒸馏

Edgar Barraza 探索了知识蒸馏,以使强大的 transformer 语言模型在移动设备上更易于访问。该项目利用一个大型且训练充分的 transformer 作为 "教师" 来训练一个较小且未训练的 "学生" 网络,在不牺牲显著能力的前提下降低模型规模。

通过强化学习进行情感分析

Helen (Mengxin) Ji 提出了结合强化学习(RL)和监督 NLP 方法的模型,以预测句子情感。结果表明,添加 RL 方法可以提高超过 transformer 模型的性能,并产生与预训练 BERT 模型相当的结果,这凸显了明确定义的奖励函数在分类问题中 RL 训练的关键作用。

强化学习与机器人技术

本届研究重点在于解决稀疏奖励问题和优化决策过程。

好奇心驱动的机器人操作

Jonathan Michaux 使用内在动机——具体来说是好奇心驱动的探索——来解决外在奖励稀疏或缺失的机器人任务。通过将内在奖励定义为智能体在给定当前状态和动作的情况下预测其下一个状态的能力的误差,该项目在仿真中成功解决了几个具有挑战性的机器人操作任务。

优化医疗治疗

Elynn Chen 开发了一套系统,利用历史电子健康记录(EHR)来推荐最佳治疗方案,具体来说是静脉输液和血管加压药的剂量。通过策略迭代和表格 Q-learning,结果表明最佳的 RL 策略推荐的静脉输液剂量较低、血管加压药剂量较高,而实际医生的治疗则相反。离策略评估表明,Q-learning 提供的奖励高于策略迭代。

DQN 中折扣因子的分析

Yuhao Wan 调查了折扣因子(gamma)在深度 Q 网络(DQN)中的作用。该项目发现折扣因子既编码了时间间隔偏好,也编码了自助引导的置信度。这促使开发出一种 "近视方案",在自定义的 Gridworld 环境中提升了基线性能,并在超出 DQN 框架的更一般环境中证明了其鲁棒性。

模型可解释性与教育应用

两个项目专注于神经网络的透明度以及机器学习在教育中的实际应用。

使用 Activation Atlases 可视化 GANs

Janet Brown 使用 Activation Atlases 技术来评估和理解图像合成生成对抗网络(GANs)。这种方法允许在数值和高度可视化的层面上测量真实图像与假图像之间的差异,为理解神经网络所感知的内容提供了一个窥探 "黑箱" 的机会。

教育领域的自动化项目标注

Nancy Otero 开发了 CREATURE,这是一个概念验证模型,旨在为教师在线项目进行标注。由于基于项目的学习效果显著,但寻找适当标注的项目却很困难,CREATURE 通过以 75–90% 的准确率在线项目进行标注提供了解决方案。

Sources