OpenAI RL-Teacher リリース

OpenAIは、時折の人間のフィードバックを使用してAIエージェントを訓練するように設計されたオープンソース実装であるRL-Teacherをリリースしました。このアプローチは、報酬が指定しづらい強化学習問題において特に有用な、手作業で作成された報酬関数の必要性を置き換え、安全なAIシステムを開発するための一歩となります。

RL-Teacherの主要コンポーネント

RL-Teacherは、3つの主要コンポーネントからなるモジュラーシステムを提供します。

  • Reward Predictor: エージェントが取る行動のうち、人間が承認するものを予測することを学ぶプラグ可能なコンポーネント。
  • Example Agent: 報酬予測器によって指定された関数を介して学習するエージェント。このリリースには、OpenAI Baselines PPOを含む3つの事前に統合されたアルゴリズムが含まれています。
  • Web-App: 報酬予測器を訓練するために必要なフィードバックを人間が提供できるユーザーインターフェース。

技術的実装と使用方法

RL-Teacherシステムは軽量で、エージェントを除いて1,000行未満のPythonコードで構成されています。

実験を起動するには、ユーザーはウェブサーバーをセットアップし、次のコマンドを実行できます:

python rl_teacher/teach.py -p human --pretrain_labels 175 -e Reacher-v1 -n human-175

人間は、ローカルまたは別のマシンで実行できるシンプルなウェブインターフェースを通じてフィードバックを提供します。完全なドキュメントは、プロジェクトのGitHubリポジトリで利用可能です。

Sources