OpenAI 시뮬레이션에서 일반화하기

OpenAI는 시뮬레이션에서 entièrement 훈련된 로봇 컨트롤러를 물리적 로봇에 배포하고 계획되지 않은 환경 변화에 반응할 수 있게 하는 로봇 기술을 개발했습니다. 이 변화는 시뮬레이터가 물리적 세계와 완벽히 일치할 것을 요구하지 않고도 실세계 동적에 적응할 수 있는 폐쇄 루프 시스템을 생성할 수 있게 합니다.

환경 적응을 위한 동역학 랜덤화

동역학 랜덤화는 다양한 시뮬레이션 조건에서 훈련함으로써 로봇이 알 수 없는 실제 세계 동적에 적응할 수 있게 합니다. 현실의 완벽한 복제를 시도하는 대신, OpenAI는 훈련 중에 아흔오 가지不同的 속성을 랜덤화하며, 포함되는 것은:

  • 로봇 몸체의 각 링크의 질량.
  • 대상 객체의 마찰과 감쇠.
  • 객체를 지지하는 테이블의 높이.
  • 행동 간의 지연 시간.
  • 관측 노이즈.

이를 구현하기 위해 OpenAI는 LSTM 기반 정책을 사용하여 하키 퍽을 밀도록 로봇을 훈련시켰습니다. 표준 피드-포워드 네트워크는 이 작업에서 실패했지만, LSTM은 과거 관측을 활용하여 세계 동적을 분석하고 실시간으로 행동을 조정할 수 있기 때문에 성공했습니다.

엔드 투 엔드 비전-투-액션 학습

OpenAI는 강화 학습(RL)을 사용하여 시뮬레이션에서 엔드 투 엔드로 로봇을 성공적으로 훈련시켜 비전을 직접 행동으로 매핑했습니다. 이 시스템은 특수 센서 없이 작동하며 시각적 피드백에 기반하여 적응합니다.

Hindsight Experience Replay(HER)를 통한 희소 보상 극복

기존 RL 알고리즘은 밀집 보상(단계별 상세 점수)이 필요하기 때문에 픽-앤-플레이스 작업에서 종종 어려움을 겪습니다. 이를 해결하기 위해 OpenAI는 에이전트가 이진 보상에서 학습할 수 있게 하는 Hindsight Experience Replay(HER)를 개발했습니다. HER는 에이전트가 의도하지 않은 상태에 도달하려는 성공적인 시도로 실패를 간주하게 하여, 주요 목표가 달성되었는지 여부와 관계없이 모든 상호작용에서 학습할 수 있게 합니다.

비대칭 액터-크리틱 아키텍처

HER 구현은 시뮬레이션과 현실 사이의 격차를 메우기 위해 비대칭 정보를 사용하는 액터-크리틱 기법을 활용합니다:

  • 크리틱: 시뮬레이터의 전체 상태에 접근하여完全 정확한 피드백을 제공하고 Q-값(미래 보상의 합)을 추정합니다.
  • 액터: RGB와 깊이 데이터만 접근할 수 있어, 정책이 물리적 세계에서 이용 가능한 데이터에만 의존하도록 보장합니다.

비전 시스템이 실제 세계에 충분히 robust하도록 보장하기 위해, OpenAI는 형태에 도메인 랜덤화를 적용했습니다.

계산 비용 및 전략적 전망

이러한 랜덤화 기술을 구현하면 훈련의 계산 오버헤드가 증가합니다. 동역학 랜덤화는 훈련 속도를 3배 느리게 만들고, 상태 대신 이미지에서 학습하는 것은 5~10배 더 느립니다.

OpenAI는 범용 로봇을 구축하기 위한 세 가지 주요 경로를 제시합니다:

  1. 물리적 로봇의 대규모 함대에서 훈련하기.
  2. 시뮬레이터의 충실도를 높여 실제 세계와 일치시키기.
  3. 시뮬레이터를 랜덤화하여 모델이 실제 세계에 일반화할 수 있도록 하기.

OpenAI는 세 번째 접근 방식—일반화를 위한 랜덤화—이 해결책의 가장 중요한 구성 요소가 될 것이라고 점점 더 믿고 있다고 밝혔습니다.

Sources

관련