OpenAI 学習成果測定スイート

OpenAI は、University of Tartu と Stanford University の SCALE Initiative と共同で開発した Learning Outcomes Measurement Suite を導入しました。このフレームワークは、テストスコアのような狭いパフォーマンス指標を超えて、さまざまな教育環境における AI の学習成果への耐久的かつ長期的な影響を評価します。

学習成果測定スイートのフレームワーク

Learning Outcomes Measurement Suite は、スケールで学習者への AI の影響を追跡するために設計された構造化システムです。モデルの振る舞い、学習者の反応、測定可能な認知的成果という 3 つの主要シグナルを以下のコンポーネントで統合します。

  • モデルの振る舞いを洗練するシステム指示: 特定の教育アプローチに合わせてモデルの振る舞いを調整するために使用される自然言語指示。
  • 学習インタラクション分類器: 匿名化されたインタラクション内の「学習瞬間」を自動的に検出し、エンゲージメントやエラー訂正などの特性にラベル付けするツール。
  • 学習品質評価者: 学習者が目標を達成したか、インタラクションが優れた教育原則に従っていたかを評価するシステム。
  • 縦断的学習評価者: 時間経過に伴う個人およびコホートレベルのエンゲージメント、持続性、メタ認知戦略の変化を追跡するツール。
  • 標準化された認知・メタ認知測定: ChatGPT を通じて提供される、批判的思考、創造性、記憶のベースラインを設定し変化を測定する検証済みのサードパーティツール。

包括的学習能力の測定

単に試験スコアに焦点を当てるのではなく、測定スイートは学習を支える深層的な認知的影響と包括的能力を追跡します。具体的には以下を評価します。

  • 自律的動機付け: 学習者がモデルに指示されるのではなく、自ら学習を形作る程度。
  • 生産的エンゲージメント: 教育的インタラクションの頻度、種類、質。
  • 課題持続性: 学習者が認知的課題を乗り越えて持続する度合い。
  • メタ認知: 学習者が学習計画、振り返り、モニタリングに努める質と頻度。
  • リコール: 過去のインタラクションから内容を正確に思い出す能力。

初期研究とスタディモードの結果

このスイートの開発は、カスタムシステム指示によって駆動される「スタディモード」に関する初期研究に基づいています。この機能は、即時の回答を提供するのではなく、足場形成、理解度チェック、ガイド付き練習を支援するよう設計されています。

300 人以上の大学生を対象に、神経科学とミクロ経済学の試験準備を行ったランダム化研究において、OpenAI は以下の結果を観測しました。

  • ミクロ経済学: スタディモードへのアクセスが割り当てられた学生は、意味のある向上を示し、試験スコアは AI 未使用の対照群に比べ約 15% 高かった。
  • 神経科学: スタディモードの結果は方向性としてはプラスの差異を示したものの、従来のオンライン教材で学習する学生との差は区別できなかった。

検証とラーニングラボエコシステム

OpenAI は現在、大規模研究を通じて測定スイートの検証を進めています。これには University of Tartu と Stanford の SCALE Initiative とのパートナーシップが含まれ、エストニアの 16〜18 歳の学生約 20,000 人を数か月にわたって対象としています。

さらに、OpenAI は Learning Lab を設立しました。これは Arizona State University、UCL Knowledge Lab、MIT Media Lab などの創設パートナーを特徴とする研究エコシステムです。ラボはまた、Bocconi University、Innova Schools、Dartmouth の Tuck School of Business、San Diego State University、Stony Brook University などの機関と連携し、学習と労働の交差点に関する研究も支援しています。

Sources