OpenAI 学习成果测量套件

OpenAI 推出了学习成果测量套件,这是一个与塔尔图大学和斯坦福大学的 SCALE 计划合作开发的框架,用于衡量 AI 随时间对学生进步和认知发展的影响。该倡议超越了诸如考试成绩等狭窄的绩效信号,评估 AI 在多样化教育环境中对学习成果的持久、长期影响。

学习成果测量套件框架

学习成果测量套件是一个结构化系统,旨在大规模跟踪 AI 对学习者的影响。它通过以下组件整合了三类主要信号——模型行为、学习者响应和可衡量的认知结果:

  • 系统指令以优化模型行为:使用自然语言指令将模型行为与特定教学方法对齐。
  • 学习交互分类器:自动检测去标识化交互中的“学习时刻”,并标记诸如参与度和错误纠正等特征的工具。
  • 学习质量评分器:评估学习者是否达成目标以及交互是否遵循强有力的教学原则的系统。
  • 纵向学习评分器:随时间跟踪个人和群体层面在参与度、坚持性和元认知策略方面的变化的工具。
  • 标准化认知与元认知测量:通过 ChatGPT 提供的经过验证的第三方工具,用于建立基线并衡量批判性思维、创造力和记忆的变化。

衡量整体学习能力

该测量套件不只关注考试成绩,而是追踪更深层的认知影响和支撑学习的整体能力,包括:

  • 自主动机:学习者在多大程度上自行安排学习,而不是被模型指引。
  • 富有成效的参与:教学交互的频率、种类和质量。
  • 任务坚持性:学习者在面对认知挑战时的坚持程度。
  • 元认知:学习者计划、反思和监控学习方法的质量和频率。
  • 回忆:对先前交互内容的记忆准确性。

早期研究与学习模式结果

该套件的开发受早期对“学习模式”的研究启发,该功能由自定义系统指令驱动,旨在支持脚手架、理解检查和引导练习,而非提供即时答案。

在一项针对 300 多名大学生准备神经科学和微观经济学考试的随机研究中,OpenAI 观察到以下结果:

  • 微观经济学:使用学习模式的学生取得了显著提升,考试成绩相较于未使用 AI 的对照组大约高出 15%。
  • 神经科学:学习模式显示出方向性积极差异,但与使用传统在线资源学习的学生之间没有显著区别。

验证与 Learning Lab 生态系统

OpenAI 正在通过大规模研究验证该测量套件。这包括与塔尔图大学和斯坦福 SCALE 计划的合作,涉及在爱沙尼亚的近 20,000 名 16-18 岁学生,持续数月。

此外,OpenAI 已建立 Learning Lab,一个研究生态系统,创始合作伙伴包括亚利桑那州立大学、UCL 知识实验室和 MIT 媒体实验室。该实验室还支持与学习和劳动交叉领域的研究,合作机构包括博科尼大学、Innova Schools、达特茅斯塔克商学院、加州州立大学圣迭戈分校和石溪大学。

Sources