OpenAI 2021 學者計畫:最終專案

OpenAI 已發布 2021 學者計畫的最終專案,展示了一系列聚焦於縮放定律、模型架構以及 AI 系統對齊的研究計畫。該計畫旨在為代表性不足群體的個人提供研究經驗,使他們能夠為深度學習的前沿做出貢獻。

縮放定律與語言遷移

Christina Kim 的研究探討了英語預訓練在跨語言遷移學習中的效果。研究發現,預訓練的英語模型在學習德語時提供最大的收益,其次是西班牙語,然後是中文。此外,英語到這三種語言的遷移在計算量、資料量和參數方面呈現可預測的縮放。

獎勵建模與回饋迴路

研究 AI 模型如何與人類價值和數據生態系統互動是幾位學者的主要焦點:

  • 大規模獎勵建模: Jonathan Ward 證明,獎勵模型(通常基於人類回饋進行訓練)可以利用從網站提取的大規模結構化回饋進行訓練。
  • 觀點建模: Danielle Ensign 調查了深度學習模型對觀點生態系統的影響,以及迭代訓練對先前模型輸出(回饋迴路)的影響。

模型架構與表示學習

多個專案聚焦於各種 AI 架構的技術限制與效能:

  • 對比學習: Ellie Kitanidis 使用純粹的對比目標預訓練語言表示模型,以研究其泛化能力與可擴展性,並與傳統語言建模目標進行比較。Legg Yeung 以「SET」卡牌遊戲來探討向量表示維度與任務組合之間的關係,發現具有 X 參數的非對比模型能解決具有 2X+ 參數的對比模型無法解決的遊戲。* Transformer 變體: Shola Oyedele 研究了不同 Transformer 架構變體的縮放定律,以了解架構對訓練成本與模型效能之間權衡的影響。* 詞元化: Sam Gbafa 探討了不同語言詞元化方案的權衡與縮放,包括學習序列的分割而非使用預定義方案的方法。

強化學習與計算效率

此控制與計算領域的專案探討了如何模擬複雜行為並優化資源使用:

  • 連續控制: Florentine (Tyna) Eloundou 開發了「多專家、多目標」(MEMO)方法。此方法使代理能夠從具有不同目標的多位專家的成功範例中學習單一條件策略,然後由主管依其酌量進行導向。* 測試時計算: Kudzo Ahegbebu 探討了在自回歸 Transformer、深度平衡模型與圖神經網路上利用測試時計算時的普遍性。研究調查了小型是否能利用測試算參數較少的限制。

學者對深度學習研究的見解

2021 學者分享了幾條進入 AI 領域研究的關鍵建議:

"My advice to someone starting in deep learning research is to take your time to understand insights from fundamental papers and remember that the field is still relatively new. There’s a lot of room for individuals to have an outsized impact."\n "If you can, take a few months to carefully work through the 2019 fast.ai course (parts 1 and 2), Andrew Ng’s deep learning course on Coursera, David Silver’s RL Course, and Spinning Up in Deep RL... try to implement a few papers from scratch in pytorch."\n "Find the simplest interesting idea that you can think of and build it!"\n "I would recommend slowly stepping through clean open source implementations of well-known algorithms while reading their theoretical grounding."}

Sources