OpenAI Scholars 2020 Final Projects

OpenAI 已發布 2020 年學者計畫的最終專案,內容涵蓋了從大型語言模型的解釋性到深度學習在神經科學中的應用等各種研究計畫。這些專案展示了 AI 在解決信用分配、社會學習和對抗性魯棒性等複雜問題上的應用。

Neural Network Interpretability and Language Models

2020 年的學員研究重點集中在模型如何表示資訊以及如何透過對抗性輸入來操縱模型。

Grammatical Representation in GPT-2

Alethea Power 研究了 GPT-2 如何表示英語語法,並識別出似乎與特定語法結構相對應的小型子網路。這項工作旨在提高網路效率,並為模型行為和人類認知提供見解。

Universal Adversarial Perturbations

Pamela Mishkin 在語言模型的背景下探索了通用對抗性範例。該研究涉及複製結果以產生 GPT-2 的通用對抗性觸發器,並攻擊 Natural Language Inference (NLI) 模型,以更深入了解生成式模型的脆弱性。

Reinforcement Learning (RL) and Agent Behavior

幾個專案解決了 RL 中的基本挑戰,特別是關於獎勵稀疏性、多智能體互動和模型量化。

Temporal Reward Transport (TRT)

Cathy Yeh 解決了長期信用分配問題——即稀疏獎勵以及動作與效果之間的時間延遲會阻礙樣本效率。透過使用注意力機制來識別重要的狀態-動作對,並透過「temporal reward transport」利用來自遙遠未來的獎勵來增強它們,Yeh 在使用標準 advantage actor-critic 演算法的 gridworld 實驗中展示了改進的學習效果。

Social Learning in Multi-Agent RL

Kamal Ndousse 研究了在共享環境中獨立 RL 智能體之間的專業知識社會化轉移。該專案研究了新手智能體是否可以透過模仿專家智能體的行為,來解決在孤立狀態下無法掌握的困難探索任務。

Social Learning in Multi-Agent RL

Kamal Ndousse 研究了在共享環境中獨立 RL 智能體之間的專業知識社會化轉移。該專案研究了新手智能體是否可以透過模仿專家智能體的行為,來解決在孤立狀態下無法掌握的困難探索任務。

Quantifying Interpretability in Coinrun

Jorge Orbay 開發了一種純量指標來衡量在 Procgen 的 Coinrun 上訓練的 A2C 模型的可解釋性。該指標是透過結合模型歸因與 Coinrun 資產的遮罩來建立的,用以測試多樣性假設的有效性。

Applied AI and Semantic Parsing

除了理論性的 RL 和解釋性研究之外,該計畫還產出了關於實際介面轉換和醫療診斷的工作。

English-to-GraphQL Semantic Parsing

Andre Carerra 開發了一個語義解析系統,可將英語提示詞(例如,「How many employees do we have?」)轉換為對應的 GraphQL 查詢。該專案包括建立自定義數據集、模型訓練以及用於結果驗證的互動工具。

Epileptic Seizure Prediction

Kata Slama 將深度學習應用於腦部記錄以預測癲癇發作。透過將問題構建為使用腦部數據頻譜圖表示的圖像分類任務,Slama 識別出 ResNet18 是此應用中最成功的模型。

Sources