OpenAI RL-Teacher リリース
OpenAIは、時折の人間のフィードバックを使用してAIエージェントを訓練するように設計されたオープンソース実装であるRL-Teacherをリリースしました。このアプローチは、報酬が指定しづらい強化学習問題において特に有用な、手作業で作成された報酬関数の必要性を置き換え、安全なAIシステムを開発するための一歩となります。
RL-Teacherの主要コンポーネント
RL-Teacherは、3つの主要コンポーネントからなるモジュラーシステムを提供します。
- Reward Predictor: エージェントが取る行動のうち、人間が承認するものを予測することを学ぶプラグ可能なコンポーネント。
- Example Agent: 報酬予測器によって指定された関数を介して学習するエージェント。このリリースには、OpenAI Baselines PPOを含む3つの事前に統合されたアルゴリズムが含まれています。
- Web-App: 報酬予測器を訓練するために必要なフィードバックを人間が提供できるユーザーインターフェース。
技術的実装と使用方法
RL-Teacherシステムは軽量で、エージェントを除いて1,000行未満のPythonコードで構成されています。
実験を起動するには、ユーザーはウェブサーバーをセットアップし、次のコマンドを実行できます:
python rl_teacher/teach.py -p human --pretrain_labels 175 -e Reacher-v1 -n human-175
人間は、ローカルまたは別のマシンで実行できるシンプルなウェブインターフェースを通じてフィードバックを提供します。完全なドキュメントは、プロジェクトのGitHubリポジトリで利用可能です。
Sources
- OriginalGathering human feedback