關於一階元學習演算法

OpenAI 研究人員開發了一系列一階元學習演算法,其中包括一種名為 Reptile 的新演算法,旨在尋找最佳的參數初始化,使代理人能快速適應未見過的任務。此方法僅依賴一階導數,簡化了元學習過程,降低了計算複雜度,同時在少樣本分類基準測試中保持高效能。

元學習的目標

元學習的目標是打造能在從特定分佈中抽樣的先前未見過的任務上表現良好的代理人,透過快速學會學習的方式。主要的技術挑戰在於獲得一個參數初始化,能在遇到新任務時以最少的資料與計算進行微調。

一階元學習演算法

OpenAI 分析了一系列僅使用一階導數進行元學習更新的演算法,避免了像 MAML(模型無關元學習)等演算法通常需要的計算成本高昂的二階導數。

一階 MAML

一階 MAML 是原始 MAML 演算法的近似。它透過在元更新過程中忽略二階導數來提升效率,簡化梯度計算,同時試圖保留快速適應的核心優勢。

Reptile

Reptile 是 OpenAI 介紹的全新演算法,概括了一階元學習。其運作機制如下:

  1. Task Sampling:演算法會不斷從分佈中抽樣任務。
  2. Task Training:它在該特定任務上執行多步訓練。
  3. Initialization Update:它將全域參數初始化朝向在該任務訓練後得到的權重移動。

效能與理論分析

此研究在 Finn 等人的先前發現基礎上進一步擴展,證明一階元學習演算法在已確立的少樣本分類基準上具有效能。此外,作者提供了理論分析,說明即使省略二階導數,這些一階近似仍能取得優異成果的原因。

Sources