OpenAI 딥 RL 스피닝 업

OpenAI는 누구나 딥 강화 학습(RL) 분야에서 숙련된 실무자가 될 수 있도록 설계된 교육 자료인 Spinning Up in Deep RL을 출시했습니다. 이 이니셔티브는 일반 딥 러닝보다 진입 장벽이 더 높은 것으로 OpenAI가 판단한 딥 RL에 대한 진입 장벽을 낮추는 것을 목표로 합니다.

핵심 교육 구성 요소

Spinning Up in Deep RL은 다섯 가지 주요 구성 요소를 통해 체계적인 학습 경로를 제공합니다:

  • RL 소개: 기본 이론, RL 용어 및 알고리즘 유형을 다루는 간결한 가이드.
  • 경력 안내: 전문 RL 연구 역할로 전환하는 방법을 상세히 설명한 에세이.
  • 선별된 연구: 주제별로 정리된 필수 논문 목록으로 이론 학습을 안내합니다.
  • 구현 저장소: 주요 알고리즘의 짧고 독립적인 구현을 포함하는 코드 저장소, 포함:
    • Vanilla Policy Gradient (VPG)
    • Trust Region Policy Optimization (TRPO)
    • Proximal Policy Optimization (PPO)
    • Deep Deterministic Policy Gradient (DDPG)
    • Twin Delayed DDPG (TD3)
    • Soft Actor-Critic (SAC)
  • 실용 연습: 학습한 개념을 적용할 수 있는 워밍업 연습 세트.

기술 설계 및 구현

Spinning Up 코드는 모듈성보다 명확성과 교육적 가치를 중시하도록 설계되었습니다. 신규 사용자가 이론이 코드로 어떻게 변환되는지 쉽게 이해하도록 OpenAI는 구현 간 코드 재사용을 로깅 및 병렬화 유틸리티에만 제한했습니다. 코드는 해당 문서 페이지의 의사코드와 배경 자료로 주석이 달리고 지원됩니다.

구현은 Classic Control, Box2D, MuJoCo 작업 모음의 Gym 환경과 호환됩니다. 사용자는 다음과 같은 간단한 명령줄 인터페이스로 에이전트를 실행할 수 있습니다:

python -m spinup.run ppo --env CartPole-v1 --exp_name hello_world

전략적 목표 및 커뮤니티 통합

Spinning Up은 AGI의 전 세계적 과제에 대응하기 위한 글로벌 커뮤니티 구축이라는 OpenAI 헌장의 목표를 달성하기 위한 OpenAI의 보다 넓은 교육 이니셔티브의 일부입니다. OpenAI는 RL 역량이 AI 안전과 같은 분야의 학제간 연구에 특히 가치가 있다고 언급합니다.

출시를 지원하기 위해 OpenAI는 다음 계획을 수립했습니다:

  • 즉각적인 지원: 버그 수정 및 설치 지원을 위한 3주간 고대역폭 기간.
  • 커뮤니티 검토: 커뮤니티 피드백을 기반으로 2019년 4월에 예정된 패키지의 주요 검토.
  • 오픈 개발: OpenAI Scholars와 Fellows를 위해 내부에서 이루어진 변경 사항을 공개 저장소에 푸시합니다.

파트너십 및 워크숍

OpenAI는 2019년 2월 2일 샌프란시스코에서 소프트웨어 엔지니어링 경험을 가진 개인을 대상으로 하는 딥 RL 스피닝 업 워크숍을 개최한다고 발표했습니다. 또한 OpenAI는 캘리포니아 대학교 버클리의 인간 친화 AI 센터(CHAI)와 협력하여 2019년 초에 유사한 딥 RL 워크숍을 진행했습니다.

Sources