OpenAI RL-Teacher 發布

OpenAI 已發布 RL-Teacher,一個開源實作,旨在透過偶爾的人類回饋來訓練 AI 代理。此方法取代了對手工製作獎勵函數的需求,這對於獎勵難以指定的強化學習問題特別有用,並且是發展安全 AI 系統的一步。

RL-Teacher 的核心組件

RL-Teacher 提供了一個由三個主要組件組成的模組化系統:

  • 獎勵預測器:一個可插拔的組件,能學習預測哪些動作由代理執行時會獲得人類的認可。
  • 範例代理:一個透過獎勵預測器指定的函數來學習的代理。此版本包含三個預先整合的演算法,其中包括 OpenAI Baselines PPO。
  • Web-App:一個使用者介面,允許人類提供訓練獎勵預測器所需的回饋。

技術實作與使用

RL-Teacher 系統非常輕量,不包括代理在內的 Python 程式碼少於 1,000 行。

要啟動實驗,使用者可以設置一個網頁伺服器並執行以下命令:

python rl_teacher/teach.py -p human --pretrain_labels 175 -e Reacher-v1 -n human-175

人類透過一個簡單的網頁介面提供回饋,該介面可以在本機或另一台機器上運行。完整的文件可在專案的 GitHub 儲存庫中取得。

Sources