OpenAI 멀티-목표 강화 학습 로봇 환경
OpenAI는 Multi-Goal 강화 학습(RL) 분야를 발전시키기 위해 설계된 도전적인 연속 제어 작업 세트를 도입했습니다. OpenAI Gym과 통합된 이러한 환경은 추가 입력 지침에 기반하여 다양한 목표를 달성해야 하는 에이전트를 테스트하기 위한 표준화된 프레임워크를 제공합니다.
로봇 환경 및 하드웨어
새로운 환경 세트는 기존 로봇 하드웨어를 기반으로 한 연속 제어 작업에 중점을 둡니다. 작업은 시뮬레이션하는 하드웨어별로 분류됩니다:
- Fetch 로봇 팔: 밀기, 슬라이딩, 픽-앤-플레이스 작업이 포함됩니다.
- Shadow Dexterous Hand: 손 내부 객체 조작에 초점을 맞춘 작업.
멀티-목표 RL 프레임워크
이 환경들은 멀티-목표 강화 학습 프레임워크를 활용합니다. 이 설정에서 에이전트는 달성해야 할 목표를 지정하는 추가 입력을 제공받습니다. 이는 특정 작업을 학습하는 싱글-목표 RL과 다릅니다.
엄격한 테스트 환경을 유지하기 위해, 이 세트의 모든 작업은 목표가 성공적으로 달성될 때만 에이전트가 보상을 받는 희소 이진 보상을 특징으로 하며, 밀집 보상 함수에 의해 안내되지 않습니다.
연구 목적 및 하인사이트 경험 재생
환경 출시 외에도, OpenAI의 기술 보고서는 RL 알고리즘 개선을 위한 구체적인 연구 방향을 제시합니다. 이 연구 요청의 주요 초점은 멀티-목표 RL과 하인사이트 경험 재생(HER)의 개선입니다.
HER은 도달한 상태를 가상 목표로 취급하여 에이전트가 실패로부터 학습하도록 돕는 기술로, 이를 통해 에이전트는 원래 의도한 목표를 달성하지 못한 궤적을 포함하여 모든 궤적에서 학습 신호를 추출할 수 있습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch