OpenAI 비대칭 액터-크리틱 이미지 기반 로봇 학습

OpenAI는 이미지 기반 로봇 학습을 위한 비대칭 액터-크리틱 프레임워크를 개발하여 로봇이 시뮬레이션에서 복잡한 작업을 학습하고 실제 세계로 기술을 전이할 수 있도록 하였으며, 실제 세계 훈련 데이터가 필요하지 않습니다. 이 접근 방식은 물리 시뮬레이터의 전체 상태 관측 가능성을 활용하여 더 정확한 크리틱을 훈련시키며, 액터(정책)는 실제 세계에서 encounter하게 될 동일한 부분 관측값(RGBD 이미지)으로 제한됩니다.

비대칭 액터-크리틱 아키텍처

비대칭 액터-크리틱 방법의 핵심 혁신은 훈련 중에 액터와 크리틱이 사용할 수 있는 정보를 분리하는 것입니다. 기존의 액터-크리틱 RL에서는 두 구성 요소가 일반적으로 동일한 관측 공간을 공유합니다. 이 비대칭 접근 방식에서는:

  • 크리틱: 물리 시뮬레이터가 제공하는 전체 상태 관측성을 사용하여 훈련됩니다.これにより 크리틱은 환경의 실제 상태를 정확히 이해할 수 있게 되며, 이는 '특권적' 특권 정보 스트림을 시뮬레이션합니다.
  • 액터(정책): 렌더링된 RGBD 이미지만을 입력으로 받습니다.これにより 액터는 실제 세계 배포에서 사용할 깊이와 색상이 동일한 시각적 관측값을 기반으로 작동하도록 학습됨을 보장합니다.

제공된 크리틱에 전체 상태 정보를 제공함으로써 알고리즘은 액터의 학습 과정을 더 효과적으로 안내할 수 있으며, 시뮬레이션에서의 학습 과정의 전반적인 성능과 안정성을 향상시킵니다.

시뮬레이션-실제 세계 전이

시뮬레이션 환경과 물리 세계 사이의 격차를 메우기 위해 OpenAI는 비대칭 액터-크리틱 방법과 도메인 랜덤화를 결합했습니다. 도메인 랜덤화는 시뮬레이션에서 환경의 물리적 속성과 시각적 외관을 변화시켜 실제 세계와 시뮬레이션 사이의 시각적 및 물리적 차이에 대해 정책이 강건하도록 보장합니다.

OpenAI 연구진은 시뮬레이션에서 전용으로 훈련된 정책을 실제 로봇에 성공적으로 전이함을 보여주었습니다. 로봇은 다음과 같은 여러 작업을 수행했습니다:

  • 블록 집기
  • 블록 밀기
  • 특정 위치로 블록 밀기
  • 블록 이동

이 작업들은 실제 세계 데이터 없이 훈련을 통해 달성되었으며, 이는 물리적 하드웨어에서 RL 에이전트 훈련과 관련된 비용과 위험을 줄이는 중요한 이정표입니다.

로봇 학습에 대한 함의

이 연구는 시뮬레이터의 전체 상태 관측 가능성을 활용하는 비대칭 액터-크리틱 훈련이 보다 효율적이고 robust한 로봇 학습을 가능하게 함을 보여줍니다. 액터의 입력 공간을 관측 시퀀스로부터 분리함으로써, 액터는 고충실도 크리틱의 손에 의한 지침을 기반으로 시각 입력을 행동에 매핑할 수 있으며, 전체 상태 정보를 사용할 수 없는 실제 세계 배포와 호환성을 유지합니다.

Sources

관련