OpenAI Safety Gym 출시
OpenAI는 훈련 과정에서 안전 제약 조건을 준수할 수 있는 강화 학습(RL) 에이전트의 발전 정도를 측정하기 위한 환경 및 도구 모음인 Safety Gym을 출시했습니다. 이번 출시는 알고리즘이 학습 과정에서 비용이 많이 드는 실수를 얼마나 효과적으로 피하는지 결정하기 위해 알고리즘을 비교하는 표준화된 방법을 제공하며, 이는 실제 로봇 공학이나 인터넷 기반 작업에 RL을 배포하는 데 매우 중요합니다.
강화 학습에서의 탐색 위험성
강화 학습 에이전트는 시행착오를 통해 최적의 행동을 학습하며, 이 과정을 탐색(exploration)이라고 합니다. 그러나 탐색은 근본적으로 위험합니다. 에이전트가 위험한 행동을 시도하여 피하는 법을 배우기 전에 수용할 수 없는 오류를 초래할 수 있기 때문입니다. 예를 들어, 공장의 자율 로봇 팔은 초기 훈련 중에 무작위로 휘둘러질 수 있으며, 이는 주변의 인간 작업자에게 안전 위험을 초래할 수 있습니다.
제한된 환경에서 단순한 물리적 장벽이나 비상 정지 장치가 위험을 완화할 수 있지만, 다양한 조건에서 작동하는 일반적인 RL 시스템은 안전한 탐색을 위한 더 강력한 알고리즘적 접근 방식이 필요합니다.
공식화로서의 제약 강화 학습
안전한 탐색 문제를 해결하기 위해 OpenAI는 제약 강화 학습(constrained reinforcement learning)의 형식을 채택했습니다. 에이전트가 보상 함수를 최대화하는 것만을 추구하는 표준 RL과 달리, 제약 RL은 에이전트가 반드시 제약해야 하는 비용 함수를 도입합니다.
보상 vs. 비용 함수
표준 RL에서 안전은 종종 보상 함수에 페널티를 포함함으로써 처리됩니다. 이 접근 방식은 보상 설계가 어렵기 때문에 문제가 됩니다. 만약 작업을 완료하는 것에 대한 보상이 충분히 높다면, 에이전트는 총 수익을return을 최대화하기 위해 빈번한 충돌이나 위험한 행동을 수용할 수 있습니다.
제약 RL에서 개발자는 훈련 시작 시 허용 가능한 비용 비율(예: 허용 가능한 충돌률)을 지정합니다. 그러면 알고리즘은 에이전트가 해당 특정 안전 요구 사항을을 충족할 때까지 페널티(즉, "cost fine")를 조정합니다. 이를 통해 시스템이 임의의 절충안 대신 결과를 우선시할 수 있도록 합니다.
Safety Gym 환경 및 도구
Safety Gym은 로봇이 특정 작업을 수행하기 위해 복잡한 공간을 탐색해야 하는 다양한 환경을 제공합니다. 이 모음에는 세 가지 로봇 유형, 세 가지 주요 작업, 그리고 각 작업에 대한 두 가지 난이도가 포함되어 있습니다.
로봇 구성
- Point: 회전 및 전진/후진을 위한 액추에이터가 있는 간단한 2D 로봇으로, 밀기 작업을 위해 작은 사각형을 특징으로 합니다.
- Car: 두 개의 독립적으로 구동되는 평행 바퀴와 자유롭게 구르는 후륜이 있는 로봇으로, 이동을 위해 조정된 액추에이터 제어가 필요합니다.
- Doggo: 양측 대칭을 가진 사족보행 로봇으로, 엉덩이 방위각, 고도, 무릎 각도를 제어합니다.
작업 유형
- Goal: 로봇은 일련의 목표 위치로 이동해야 합니다.
- Button: 로봇은 일련의 목표 버튼을 눌러야 합니다.
- Push: 로봇은 상자를 목표 위치의 일련의 위치로 이동시켜야 합니다.
이 환경에서 장애물에 부딪히는 것은 안전하지 않은 행동으로 정의되며, 빨간색 경고등이 켜지고 작업 보상과는 별개로 비용이 발생합니다.
벤치마킹 및 예비 결과
OpenAI는 PPO, TRPO, Lagrangian penalized versions of PPO and TRPO, 그리고 Constrained Policy Optimization (CPO)를 포함한 여러 표준 RL 및 제약 RL 알고리즘을 Safety Gym 벤치마크 모음 suite를 사용하여 평가했습니다.
예비 결과에 따르면 환경의 난이도가 크게 다르며, 일부는 해결하기 쉬운 반면 다른 일부는 현재 기술로 너무 도전적인 것으로 나타났습니다. 특히, OpenAI는 Lagrangian 방법이 CPO보다 놀라울 정도로 더 나은 성능을 보여주었다는 것을 발견했으며, 이는 해당 분야의 이전 연구 결과와 상치합니다.
재현성을 지원하기 위해, OpenAI는 Safety Starter Agents repository를 통해 알고리즘 코드를 공개했습니다.
향후 연구 방향
OpenAI는 제약 RL의 추가적인 개선을 위한 세 가지 주요 분야를 식별했습니다:
- 현재 Safety Gym 환경 내에서 에이전트 성능을 향상시키는 것.
- Safety Gym을 사용하여 분포 변화(distributional shift)와 안전한 전이 학습(safe transfer learning)을 조사하는 것.
- 제약 RL을 인간의 선호도와 같은 암시적 사양(implicit specifications)과 통합하여 보상을 및 비용을 정의하는 것.
OpenAI는 안전 측정 방식이 결국 개발자 평가 체계에 통합되거나 정부 기관이 AI 시스템의 위한 안전 표준을 만들기 위해 사용될 수 있다고 제안합니다.
Sources
- OriginalSafety Gym