OpenAI 影片預訓練(VPT)於 Minecraft

OpenAI 開發了影片預訓練(VPT),這是一種半監督式模仿學習方法,允許神經網路透過觀看未標記的人類影片來學習在環境中如何行動。將此方法應用於 Minecraft 後,OpenAI 展示了代理可以獲得複雜且長期的行為——例如製作鑽石工具——這在以往從頭開始的強化學習中是無法達成的。

影片預訓練(VPT)方法論

為了利用互聯網上大量未標記的影片資料,OpenAI 推出了 VPT 流程。使用網路影片的主要挑戰在於缺乏玩家實際按鍵與滑鼠移動(動作標籤)的紀錄。

逆向動態模型(IDM)

OpenAI 透過訓練逆向動態模型(IDM)解決了動作標記問題。其流程如下:

  1. 承包商資料收集:從人類承包商那裡收集了一小筆資料集,記錄影片以及相對應的動作標籤(按鍵與滑鼠移動)。
  2. IDM 訓練:訓練 IDM 以預測影片中每一步所採取的動作。與標準的行為克隆不同,IDM 能同時利用過去與未來的畫面來猜測動作。
  3. 大規模標記:訓練完成後,使用 IDM 為大量未標記的線上影片標記,產生合成的動作標記資料集。
  4. 行為克隆:接著以此 IDM 標記的資料對基礎模型進行行為克隆訓練。

VPT 基礎模型的零樣本能力

VPT 基礎模型在 70,000 小時的 IDM 標記線上影片上進行訓練。使用原生的人類介面(20Hz 影格率,搭配滑鼠與鍵盤),模型展現了多項「零樣本」能力——即在預訓練後即可執行這些任務,無需額外微調:

  • 早期遊戲序列:模型能砍伐樹木、製作木板,並建造工作台。此序列對熟練玩家通常需要約 50 秒或 1,000 個連續動作。
  • 一般生存技能:模型學會了游泳、狩獵動物以取得食物,以及進食。
  • 進階移動:模型掌握了「柱子跳躍」技巧,即不斷跳躍並在自身下方放置方塊以向上攀升。

微調與效能擴展

OpenAI 測試了 VPT 模型透過行為克隆(BC)與強化學習(RL)進行專精的能力。

行為克隆微調

透過在少量承包商建造房屋的資料集(每個世界 10 分鐘的遊玩)上微調基礎模型,模型在早期遊戲技能上顯著提升,並擴展了製作木製與石製工具、掠奪村莊箱子以及建造簡易庇護所等能力。

資料規模假說

OpenAI 假設使用承包商資料訓練 IDM 比直接使用相同資料訓練 BC 基礎模型更有效。為驗證此假說,他們在 1 至 70,000 小時的資料規模上訓練模型。結果顯示,隨著基礎模型資料量的增加,製作能力普遍提升,且石製工具的製作僅在最大資料規模時出現。

強化學習(RL)微調

結合 RL 後,VPT 模型成為強大的行為先驗。標準的從隨機初始化訓練的 RL 策略幾乎無法收集原木或木棍,而經 RL 微調的 VPT 模型在 10 分鐘的劇本中有 2.5% 能成功製作鑽石鎬。

製作鑽石工具通常需要熟練玩家超過 20 分鐘(約 24,000 個動作)。這是首次有電腦代理在 Minecraft 中使用原生人類介面達成此能力。

對通用電腦使用代理的啟示

OpenAI 結論認為 VPT 為從網路影片學習行為先驗提供了一條道路,超越了僅有的表徵先驗。由於 Minecraft 是開放式且使用通用的滑鼠與鍵盤介面,OpenAI 認為此結果顯示出開發能以類似人類方式使用電腦的通用代理的潛力。

Sources