OpenAI學習成果測量套件

OpenAI推出了學習成果測量套件,這是一個與塔爾圖大學(University of Tartu)及斯坦福大學的SCALE計畫(SCALE Initiative)合作開發的框架,用以衡量 AI 隨時間對學生進步與認知發展的影響。此倡議超越了僅以測驗分數等狹隘績效指標,評估 AI 在多元教育情境中對學習成果的持久、長期影響。

學習成果測量套件框架

學習成果測量套件是一個結構化系統,旨在大規模追蹤 AI 對學習者的影響。它透過以下組件,整合三項主要訊號——模型行為、學習者回應與可測量的認知成果:

  • 系統指令以精煉模型行為:使用自然語言指令,使模型行為與特定教學方法保持一致。
  • 學習互動分類器:自動偵測去識別化互動中的「學習時刻」,並標記如參與度與錯誤更正等特徵的工具。
  • 學習品質評分器:評估學習者是否達成目標,以及互動是否遵循健全教學原則的系統。
  • 縱向學習評分器:隨時間追蹤個人與群體層面的參與度、堅持度與後設認知策略變化的工具。
  • 標準化認知與後設認知測量:透過 ChatGPT 提供的經驗驗證第三方工具,建立基線並測量批判性思考、創造力與記憶的變化。

衡量全人學習能力

與其僅關注考試分數,測量套件追蹤更深層的認知影響與支撐學習的全人能力,包括:

  • 自主動機:學習者自行規劃學習的程度,與被模型指導的程度之比較。
  • 有效參與:教學互動的頻率、種類與品質。
  • 任務堅持:學習者在認知挑戰中持續投入的程度。
  • 後設認知:學習者規劃、反思與監控學習方法的品質與頻率。
  • 回憶:對先前互動內容的記憶正確度。

初步研究與學習模式結果

此套件的開發受到早期對「學習模式」的研究啟發,該功能由自訂系統指令驅動,旨在提供支架、理解檢查與引導練習,而非直接給予答案。

在一項隨機抽樣、超過 300 名大學生準備神經科學與微觀經濟學考試的研究中,OpenAI 觀察到以下結果:

  • 微觀經濟學:使用學習模式的學生相較於未使用 AI 的對照組,考試分數提升約 15%,顯示出顯著的進步。
  • 神經科學:結果顯示學習模式有正向趨勢,但與使用傳統線上資源的學生之間差異不具顯著性。

驗證與學習實驗室生態系統

OpenAI 目前正透過大規模研究驗證此測量套件。這包括與塔爾圖大學及斯坦福的 SCALE 計畫合作,在愛沙尼亞對近 20,000 名 16 至 18 歲的學生進行為期數月的研究。

此外,OpenAI 成立了 Learning Lab,這是一個研究生態系統,創始合作夥伴包括亞利桑那州立大學(Arizona State University)、UCL Knowledge Lab 與 MIT Media Lab。該實驗室亦支援與學習與勞動交叉領域相關的研究,合作機構包括博科尼大學(Bocconi University)、Innova Schools、達特茅斯大學塔克商學院(Tuck School of Business at Dartmouth)、聖地亞哥州立大學(San Diego State University)以及石溪大學(Stony Brook University)。

Sources