OpenAI 딥러닝 강화학습에서의 안전한 탐색 벤치마킹

TL;DR

OpenAI는 안전한 탐색을 위한 주요 형식으로 제약 조건이 있는 강화학습(constrained reinforcement learning, RL)을 표준화하기 위해 Safety Gym 벤치마크 제품군을 도입했습니다. 이를 통해 연구자들은 고차원 연속 제어 환경에서 중요한 안전 제약 조건을 위반하지 않으면서 시행착오를 통해 최적의 정책을 학습할 수 있는 RL 에이전트를 개발하는 진척도를 측정할 수 있습니다.

안전한 탐색을 위한 제약 조건이 있는 RL의 표준화

안전한 탐색은 실제 세계와 상호작용하는 RL 에이전트, 특히 인간과 상호작용하는 로봇 시스템과 같이 특정 오류가 허용되지 않는 환경에서 매우 중요합니다. 현재 대부분의 RL 에이전트는 시뮬레이션에서 학습되지만, OpenAI는 에이전트를 실제 세계에서 직접 학습시키는 방향으로의 전환이 안전에 대한 더욱 강력한 접근 방식을 필요로 할 것이라고 주장합니다.

OpenAI는 제약 조건이 있는 RL을 안전한 탐색을 위한 주요 형식으로 사용할 것을 제안합니다. 제약 조건이 있는 RL은 에이전트가 특정 안전 제약 조건 세트를 준수하면서 최적의 정책을 학습할 수 있도록 하여, 학습의 탐색 단계 동안 에이전트가 허용되지 않는 행동을 하지 않도록 보장합니다.

Safety Gym 벤치마크 제품군

제약 조건이 있는 RL에 대한 연구 진척도를 측정하기 위해, OpenAI는 Safety Gym 벤치마크 제품군을을 출시했습니다. Safety Gym은 에이전트가 목표를 달성하는 동시에 안전 제약 조건을 유지하는 능력을 테스트하기 위해 특별히 설계된 새로운 고차원 연속 제어 환경들을 제공합니다.

이 환경들은 고차원 연속 제어 문제를 제공하는 시뮬레이션 환경으로, 임무는 일반적인 RL 환경과 동일하게 보상을 최대화하는 것이지만, 에이전트가 반드시 따라야 하는 일련의 제약 조건이 함께 제공됩니다.

향후 연구를 위한 베이스라인 구축

OpenAI는 베이스라인을 구축하기 위해 Safety Gym 환경에서 여러 제약 조건이 있는 딥러닝 강화학습 알고리즘을 벤치마킹했습니다. 이러한 벤치마크를 제공함으로써, OpenAI는 안전한 탐색 및 안전한 강화학습 분야의 향후 연구를 위한 기준점을 제공합니다.

Sources