Jack of All Trades (JAT) 多用途變換器代理

Hugging Face 已宣布 Jack of All Trades (JAT),這是一個通用代理專案,旨在使用單一網路執行各種視覺與語言以及決策任務。此專案作為 Gato 架構的開放再現,提供完整的專家強化學習代理、專門的訓練資料集以及多模態變換器模型。

JAT 資料集與專家策略

JAT 專案提供了首個專為通用代理訓練設計的資料集,包含數十萬條專家軌跡。這些軌跡是透過在多個多樣化環境中訓練最先進的專家代理所產生的,包括:

  • Atari:經典街機遊戲。
  • BabyAI:簡單的導航環境(使用 BabyAI 機器人)。
  • Meta-World:機器人操作任務。
  • MuJoCo:基於物理的連續控制。

為了提供統一的使用者介面,JAT 資料集亦整合了來自 Wikipedia、Oscar、OK-VQA 與 Conceptual-Captions 的文字資料。

JAT 代理架構

JAT 基於 EleutherAI 的 GPT‑Neo 實作建構。此架構設計用於處理序列決策任務,透過交錯觀測嵌入、動作嵌入與相應獎勵來運作。

嵌入與編碼機制

JAT 依據資料模態使用不同的編碼策略:

  • 圖像(例如 Atari):透過卷積神經網路(CNN)處理。
  • 連續向量:透過線性層處理。
  • 離散值:透過線性投影層處理。
  • 文字:使用 GPT‑2 策略進行分詞。
  • 一般圖像:使用 ViT 類型編碼器處理。

預測與損失函數

模型使用因果遮罩自回歸地預測下一個嵌入,將觀測值向前移動一個時間步,使代理必須根據先前的觀測與動作來預測下一個動作。損失會針對每種模態分別計算:

  • MSE 損失:用於圖像與連續值。
  • 交叉熵損失:用於離散值。

最終損失為序列中每個元素損失的平均值。

效能結果

JAT 在 157 個訓練任務上進行評估,於四個主要領域中相較於專家代理,平均表現為 65.8%。

領域特定效能

  • BabyAI:達到專家分數的 99.0%,僅有一個任務未能超過專家 50%。
  • MuJoCo:達到專家分數的 84.8%。
  • Meta-World:達到專家分數的 65.5%。
  • Atari 57:達到專家分數的 14.1%(相當於人類表現的 37.6%),在 21 款遊戲中超過人類表現。

雖然模型在自然語言處理與電腦視覺任務上顯示出基礎能力,但其主要優勢在於能以單一網路模仿專家在這些多樣化強化學習領域的表現。

觀測預測的影響

JAT 專案期間的研究探討了要求代理預測未來觀測(除了最大化獎勵)是否能提升學習。透過使用權重參數 $\kappa$ 來平衡觀測損失與動作損失,團隊發現 $\kappa = 0.005$ 為「最佳點」。

在此特定權重下,學習預測觀測提升了代理的學習效率。然而,當 $\kappa$ 過高(例如 0.5)時,預測觀測的目標會妨礙學習過程。這表明若能正確平衡,輔助目標對通用代理是有益的。

未來研究方向

為了進一步發展 JAT 代理,Hugging Face 確定了三個主要改進方向:

  1. 資料品質:透過收集更多來自更廣泛專家代理的軌跡來擴充資料集,以降低偏差。
  2. 離線強化學習:超越基本的行為克隆,使代理能利用次優軌跡,甚至有可能超越專家。
  3. 抽樣策略:實施動態多任務抽樣策略,以聚焦於較具挑戰性的任務,而非均勻抽樣。

Hugging Face 推出 Jack of All Trades (JAT),一個基於單一變換器的代理,能在 Atari、BabyAI、Meta-World 與 MuJoCo 環境中執行多樣的序列決策任務。

Sources