OpenAI 로봇이 배우는 법: 시뮬레이션에서의 원샷 모방 학습
OpenAI는 한 번 시연을 본 후 새로운 작업을 배울 수 있는 로봇 시스템을 만들었습니다. 이 시스템은 시뮬레이션에서 완전히 훈련되고 실제 로봇에 배포되어 실제 이미지 훈련이 필요 없게 됩니다.
원샷 모방 학습과 VR 통합
OpenAI의 새로운 알고리즘인 원샷 모방 학습은 인간이 가상 현실(VR)에서 작업을 수행함으로써 로봇에 작업을 전달할 수 있게 합니다. 시뮬레이터에서의 단일 시연 후, 로봇은 물리 세계에서 임의의 시작 구성으로부터 동일한 작업을 해결할 수 있습니다.
시스템 아키텍처: 비전 및 모방 네트워크
비전 네트워크
비전 네트워크는 로봇 카메라의 이미지를 객체 위치의 상태 표현으로 변환합니다. 시스템이 물리 세계에 일반화되도록 보장하기 위해, 도메인 랜덤화 방법을 사용하여 네트워크를 훈련시킵니다—다양한 조명, 텍스처, 객체 교란이 있는 수만 개의 시뮬레이션 이미지에 노출시킵니다. 비전 시스템은 실제 이미지로 훈련되지 않습니다.
모방 네트워크
모방 네트워크는 시연으로부터 작업의 의도를 추론하고 새로운 환경에 일반화합니다. 각각 수천 회의 시연이 있는 수십 개의 작업에서, 서로 다른 시작 상태에서 동일한 작업을 수행하는 궤적을 쌍으로 사용하여 훈련됩니다. 지도 학습을 통해, 네트워크는 특정 관찰에서 시연자가 취한 행동을 예측하며, 객체의 특정 시작 위치보다 작업의 관련 부분을 우선시하도록 학습합니다.
블록 쌓기 적용
스크립트 정책을 사용한 훈련
블록 쌓기는 충분히 간단한 작업이기 때문에, OpenAI는 시뮬레이션에서 스크립트 정책을 사용하여 모방 네트워크의 훈련 데이터를 생성했습니다. 스크립트 데이터로 훈련되었음에도 불구하고, 모방 네트워크는 테스트 시간에 인간이 생성한 시연을 성공적으로 파싱했으며, 이전에 "혼잡한" 인간 데이터를 접한 적이 없었습니다.
소프트 어텐션을 통한 스케일링 및 일반화
모방 네트워크는 시연 궤적과 블록 위치 상태 벡터에 대해 소프트 어텐션을 활용합니다. 이 아키텍처는 시스템이 다음과 같이 작동하게 합니다:
- 가변 길이의 시연을 처리합니다.
- 훈련 중에 본 것보다 더 긴 궤적을 모방합니다.
- 훈련 세트의 어떤 시연보다 더 많은 블록을 포함하는 구성으로 블록을 쌓습니다.
노이즈 주입을 통한 견고성
정책의 견고성을 보장하기 위해, OpenAI는 훈련 중에 스크립트 정책의 출력에 소량의 노이즈를 주입했습니다. 이로 인해 스크립트 정책은 오류가 발생했을 때 복구 동작을 보여주도록 강제되었고, 이는 모방 네트워크가 불완전한 정책으로부터의 방해를 처리하는 방법을 배우게 했습니다. 이 노이즈 주입이 없었다면, 모방 네트워크는 일반적으로 쌓기 작업을 완료하지 못했습니다.
Sources
- OriginalRobots that learn