OpenAI RL-Teacher 출시

OpenAI는 occasional human feedback을 통해 AI 에이전트가 취하는 행동을 인간이 승인할 것 같다는 것을 예측하는 플러그인 가능한 구성 요소를 학습하도록 설계된 오픈소스 구현인 RL-Teacher를 출시했습니다. 이 접근 방식은 수작업으로 설계된 보상 함수의 필요성을 대체하며, 보상을 지정하기 어려운 강화 학습 문제에 특히 유용하고 안전한 AI 시스템 개발을 향한 한 걸음이 됩니다.

RL-Teacher의 핵심 구성 요소

  • Reward Predictor: 인간이 승인할 것 같은 행동을 예측하도록 학습하는 플러그인 가능한 구성 요소입니다.
  • Example Agent: 보상 예측기가 지정한 함수를 통해 학습하는 에이전트입니다. 이 릴리스에는 OpenAI Baselines PPO를 포함한 세 가지 사전 통합 알고리즘이 포함되어 있습니다.
  • Web-App: 인간에게 RL-Teacher를 훈련시키기 위한 필요한 피드백을 제공할 수 있는 사용자 인터페이스입니다.

기술적 구현 및 사용법

RL-Teacher 시스템은 가벼워서, 에이전트를 제외하고 1,000줄 미만의 Python 코드로 구성되어 있습니다.

실험을 시작하려면 사용자는 웹 서버를 설정한 후 다음 명령을 실행할 수 있습니다:

python rl_teacher/teach.py -p human --pretrain_labels 175 -e Reacher-v1 -n human-175

인간은 로컬 또는 별도의 머신에서 실행할 수 있는 간단한 웹 인터페이스를 통해 피드백을 제공합니다. 전체 문서는 프로젝트의 GitHub 저장소에서 확인할 수 있습니다.

Sources