OpenAI Scholars 2019 最終プロジェクト

OpenAIは、2019 OpenAI Scholarsプログラムの最終プロジェクトを紹介し、さまざまな学術・職業的背景を持つ個人がディープラーニングと強化学習を適用して複雑な問題を解決する方法を示しました。これらのプロジェクトは、自然言語処理、ロボット操作、医療治療の最適化、モデルの解釈可能性にわたります。

自然言語処理と理解

いくつかの学者は、特定のタスクに対するトランスフォーマーベースの言語モデルの応用と最適化に焦点を当てました。

質問応答のためのGPT-2のファインチューニング

Fatma Tarlaciは、質問応答(QA)タスクのためにGPT-2 smallモデルのファインチューニングを試みました。このプロジェクトは、QAが言語処理と推論スキルの組み合わせを必要とするため、モデルの推論メカニズムを分析することを目的としていました。

トランスフォーマーのための知識蒸留

Edgar Barrazaは、モバイルデバイスでよりアクセスしやすくするため、強力なトランスフォーマー言語モデルの知識蒸留を探求しました。このプロジェクトでは、大規模でよく訓練されたトランスフォーマーを「教師」として使用し、小規模で未訓練の「学生」ネットワークを訓練しました。これにより、重要な能力を犠牲にすることなくモデルサイズを削減しました。

強化学習による感情分析

Helen (Mengxin) Jiは、文の感情を予測するために強化学習(RL)と教師ありNLP手法を組み合わせたモデルを提案しました。その結果、RL手法を追加することでトランスフォーマーモデルよりもパフォーマンスが向上し、事前に訓練されたBERTモデルと同等の結果が得られることが示されました。これは、分類問題におけるRLトレーニングにおいて、よく定義された報酬関数が重要であることを強調しています。

強化学習とロボット工学

このコホートの研究は、スパース報酬問題の解決と意思決定プロセスの最適化に焦点を当てました。

好奇心駆動型ロボット操作

Jonathan Michauxは、内在的動機付け—具体的には好奇心駆動の探索—を使用して、外在的報酬がスパースまたは欠如しているロボットタスクを解決しました。エージェントが現在の状態と行動から次の状態を予測する能力の誤差を内在的報酬として定式化することにより、シミュレーションにおいていくつかの困難なロボット操作タスクを正常に解決しました。

医療治療の最適化

Elynn Chenは、過去の電子健康記録(EHR)を使用して、最適な治療法—具体的には静脈内輸液と血管収縮薬の投与量—を推奨するシステムを開発しました。政策反復と表形式Q学習を使用し、その結果、最適なRLポリシーは実際の医師の治療と比較して静脈内輸液の投与量を低くし、血管収縮薬の投与量を高く推奨することが示されました。オフポリシー評価では、Q学習が政策反復よりも高い報酬を提供することが示されました。

DQNにおける割引因子の分析

Yuhao Wanは、Deep Q-Networks(DQN)における割引因子(ガンマ)の役割を調査しました。このプロジェクトでは、割引因子が時間的優先度とブートストラップへの信頼の両方をエンコードしていることが特定されました。これにより、カスタマイズされたGridworld環境でのベースラインパフォーマンスを向上させる「近視スキーム」が開発され、DQNフレームワークを超えたより一般的な設定でも堅牢であることが証明されました。

モデルの解釈可能性と教育アプリケーション

2つのプロジェクトは、ニューラルネットワークの透明性と教育におけるMLの実用的応用に焦点を当てました。

アクティベーションアトラスによるGANの可視化

Janet Brownは、アクティベーションアトラスの技術を使用して、画像合成生成的敵対ネットワーク(GAN)を評価および理解しました。このアプローチにより、数値的かつ高度に視覚的な観点から実際の画像と偽の画像の違いを測定することが可能になり、ニューラルネットワークがどのように認識しているかの「ブラックボックス」への窓が提供されました。

教育のための自動プロジェクトラベリング

Nancy Oteroは、教師がオンラインプロジェクトにラベルを付けるための概念実証モデルであるCREATUREを開発しました。プロジェクトベースの学習は効果的ですが、適切にラベル付けされたプロジェクトを見つけるのは困難であるため、CREATUREはオンラインプロジェクトに75〜90%の精度でラベルを付けることで解決策を提供します。

Sources