OpenAI Scholars 2019 Final Projects
OpenAI 展示了 2019 年 OpenAI Scholars 計畫的最終專案,展示了來自不同學術和專業背景的人士如何應用深度學習和強化學習來解決複雜問題。這些專案涵蓋了自然語言處理、機器人操控、醫療治療優化以及模型可解釋性。
Natural Language Processing and Understanding
幾位學者專注於針對特定任務應用和優化基於 transformer 的語言模型。
Fine-Tuning GPT-2 for Question Answering
Fatma Tarlaci 實驗了針對問答 (QA) 任務進行 GPT-2 small 模型的微調。該專案旨在分析模型的推理機制,因為問答需要結合語言處理和推理能力。
Knowledge Distillation for Transformers
Edgar Barraza 探索了知識蒸餾技術,使強大的 transformer 語言模型在行動裝置上更易於使用。該專案利用一個大型且訓練良好的 transformer 作為「教師」,來訓練一個較小的、未經訓練的「學生」網路,在不犧牲顯著能力的同時縮小了模型大小。
Sentiment Analysis via Reinforcement Learning
Helen (Mengxin) Ji 提出了一種結合強化學習 (RL) 和監督式 NLP 方法的模型,用以預測句子情緒。結果顯示,加入 RL 方法可以比 transformer 模型提高性能,並產生與預訓練的 BERT 模型相當的結果,這突顯了定義良好的獎勵函數對於分類問題中的 RL 訓練至關重要。
Reinforcement Learning and Robotics
本屆學者的研究重點在於解決稀疏獎勵問題並優化決策過程。
Curiosity-Driven Robotic Manipulation
Jonathan Michaux 使用內在動機——特別是好奇心驅動的探索——來解決機器人任務,在這些任務中,外在獎勵是稀疏或缺失的。透過將內在獎勵公式化為:在給定當前狀態和動作後,代理人預測其下一個狀態的能力誤差,該專案成功地在模擬中解決了幾個困難的機器人操控任務。
Optimizing Medical Treatment
Elynn Chen 開發了一個使用歷史電子健康紀錄 (EHR) 來推薦最佳治療方案的系統,特別是靜脈注射液 (IV fluids) 和血管收縮劑 (vasopressors) 的劑量。透過使用策略迭代 (policy iteration) 和表格式 Q-learning,結果顯示,與實際醫師的治療相比,建議的最佳 RL 策略推薦了較低劑量的 IV fluids 和較高劑量的 vasopressors。離策略評估 (off-policy evaluation) 指出,Q-learning 提供了比策略迭代更高的獎勵。
Analysis of the Discount Factor in DQN
Yuhao Wan 投資研究了 Deep Q-Networks (DQN) 中折扣因子 (gamma) 的作用。該專案識別出折扣因子同時編碼了跨時偏好 (intertemporal preference) 和對自助法 (bootstrapping) 的信心。這促使開發了一種「近視方案」(myopia scheme),該方案在自定義的 Gridworld 環境中提高了基準性能,並證明在 DQN 框架之外的更一般化設定中也具有魯棒性。
Model Interpretability and Educational Applications
兩個專案專注於神經網路的透明度以及機器學習在教育中的實際應用。
Visualizing GANs with Activation Atlases
Janet Brown 使用 Activation Atlases 技術來評估和理解圖像合成生成對抗網路 (GANs) 。這項方法允許以數值和高度視覺化的方式衡量真實與偽造圖像之間的差異,為觀察神經網路所感知的「黑盒」提供了一個窗口。
Automated Project Labeling for Education
Nancy Otero 開發了 CREATURE,這是一個概念驗證模型,旨在為教師標註線上專案。由於專案式學習 (project-based learning) 非常有效,但尋找標註適當的專案卻很困難,CREATURE 透過以 75–90% 的準確度標註線上專案,提供了一個解決方案。