OpenAI 로봇 연구를 위한 재료
OpenAI는 여덟 개의 시뮬레이션 로봇 환경과 Baselines 구현의 후행 경험 재생(HER)를 공개했습니다. 이러한 도구는 물리 로봇으로 전이될 수 있는 모델의 훈련을 용이하게 설계되었으며, 기존 MuJoCo 연속 제어 환경보다 더 도전적인 조작 작업을 특별히 대상으로 합니다.
시뮬레이션 로봇 환경
OpenAI는 MuJoCo 물리 시뮬레이터를 사용하는 Gym용 여덟 개의 새로운 환경을 제공하며, 두 로봇 플랫폼으로 나뉩니다:
Fetch 연구 플랫폼
- FetchReach-v0: 로봇은 특정 목표 위치로 엔드 이펙터를 이동해야 합니다.
- FetchSlide-v0: 로봇은 테이블 위의 퍽을 쳐서 원하는 목표 위치에서 미끄러져 멈추도록 해야 합니다.
- FetchPush-v0: 로봇은 상자가 원하는 목표 위치에 도달할 때까지 밀어야 합니다.
- FetchPickAndPlace-v0: 로봇은 테이블에서 상자를 집어 들어 테이블 위의 목표 위치로 이동해야 합니다.
ShadowHand 로봇
- HandReach-v0: 로봇은 엄지와 선택된 손가락을 사용하여 손바닥 위의 목표 위치에서 만나야 합니다.
- HandManipulateBlock-v0: 로봇은 블록을 조작하여 원하는 위치와 회전을 달성해야 합니다.
- HandManipulateEgg-v0: 로봇은 달걀을 조작하여 원하는 위치와 회전을 달성해야 합니다.
- HandManipulatePen-v0: 로봇은 펜을 조작하여 원하는 위치와 회전을 달성해야 합니다.
목표 기반 학습과 희소 보상
모든 새로운 환경은 목표 위치나 방향과 같은 "목표" 개념을 도입합니다. 기본적으로 이러한 환경은 희소 보상을 사용합니다: 목표가 달성되면(허용 오차 내) 0, 달성되지 않으면 -1입니다. 밀도 보상 변형도 이용 가능하지만, OpenAI는 실제 로봇 응용 프로그램에 더 현실적이므로 희소 보상 사용을 권장합니다.
후행 경험 재생(HER)
희소 보상에서 학습의 어려움을 해결하기 위해—에이전트가 많은 시도 동안 지속적인 -1 신호를 받을 수 있음—OpenAI는 Baselines 구현의 후행 경험 재생(HER)를 공개했습니다.
HER는 에이전트가 에피소드 동안 실제로 달성된 목표로 원래 목표를 대체함으로써 실패로부터 학습할 수 있게 합니다. 달성된 상태를 의도된 목표로 간주함으로써, 에이전트는 주요 작업을 실패하더라도 긍정적인 학습 신호를 받습니다. 시간이 지나면서 이는 에이전트가 원래 목표를 포함한 임의의 목표를 달성하는 방법을 배우게 합니다.
HER는 다른 오프폴리시 방법과 결합할 수 있는 오프폴리시 강화 학습 알고리즘이며, 예를 들어 Deep Deterministic Policy Gradient (DDPG)와 결합할 수 있습니다. 테스트에서, 희소 보상을 사용하는 DDPG + HER 조합은 바닐라 DDPG뿐만 아니라 밀도 보상을 사용하는 DDPG + HER보다 어려운 작업인 HandManipulateBlockRotateXYZ-v0에서 znacz하게 더 우수한 성능을 보였습니다.
HER를 위한 미래 연구 방향
- Automatic Goal Creation: 하드코딩된 방법을 사용하는 대신 하인사이트 목표를 선택하는 전략을 학습합니다.
- Unbiased HER: 목표 대체로 인한 잠재적인 불안정성을 방지하기 위해 중요도 샘플링을 사용하여 HER의 편향되지 않은 버전을 도출합니다.
- HER + HRL: 상위 수준 정책에 의해 생성된 행동에 하인사이트를 적용하기 위해 HER와 계층적 강화 학습(HRL)을 결합합니다.
- Richer Value Functions: 성공 임계값이나 할인 요인과 같은 추가 입력에 가치 함수를 조건화합니다.
- Faster Information Propagation: 안정성을 희생하지 않고 훈련 속도를 높이기 위해 타깃 네트워크의 대안을 조사합니다.
- HER + Multi-step Returns: 목표 대체의 오프폴리시 특성에도 불구하고 멀티스텝 반환을 사용하는 방법을 찾습니다.
- On-policy HER: 안정적인 온폴리시 알고리즘(예: PPO)과 HER의 조합을 중요도 샘플링을 통해 탐색합니다.
- Sample Efficiency: 행동 빈도가 무한대로 증가해도 성능을 유지하는 알고리즘을 설계합니다.
- Integration: Prioritized Experience Replay, distributional RL, 또는 entropy-regularized RL과 같은 발전과 HER를 결합합니다.
목표 기반 환경을 위한 Gym API 변경 사항
이러한 환경을 지원하기 위해 Gym API가 다음과 같이 업데이트되었습니다:
- Observation Space: 목표 기반 환경은 이제
desired_goal,achieved_goal, 그리고observation(로봇의 상태)를 포함하는gym.spaces.Dict관찰 공간을 사용합니다. - Reward Function Exposure: 환경의 보상 함수가 이제 노출되어, 알고리즘이 대체된 목표에 기반하여 보상을 재계산할 수 있게 됩니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch