OpenAI 원샷 모방 학습

OpenAI는 원샷 모방 학습을 위한 메타 학습 프레임워크를 개발하여, 로봇이 단일 시연으로부터 작업을 학습하고 해당 작업의 새로운 인스턴스에 즉시 일반화할 수 있도록 했습니다. 이 접근 방식은 기존 모방 학습에 일반적으로 필요한 광범위한 특성 엔지니어링이나 큰 샘플 크기의 필요성을 제거합니다.

일반화를 위한 메타 학습 프레임워크

원샷 모방 학습은 어떻게 배울지를 배우기 위한 메타 학습 접근 방식을 활용합니다. 특정 작업을 고립 상태에서 해결하는 대신, 모델은 여러 인스턴스를 가진 대규모 작업 세트에서 훈련됩니다. 예를 들어, 작업은 블록을 하나의 탑으로 쌓거나 두 블록 탑으로 배열하는 것을 포함할 수 있습니다. 작업의 각 인스턴스는 서로 다른 초기 상태와 다른 블록 세트를 포함합니다.

훈련 과정

훈련 중에 알고리즘은 시연 쌍을 제시받습니다. 신경망은 두 가지 입력, 즉 한 번의 시연과 로봇의 현재 상태를 취하도록 훈련됩니다. 이 과정에서 모델은 쌍의 두 번째 시연의 상태 및 행동 시퀀스와 일치시키려고 시도합니다. 목표는 두 번째 시연과 가능한 한 가깝게 일치하는 상태 및 행동 시퀀스를 결과로 내는 행동을 출력하는 것입니다.

테스트 시간 성능

테스트 시점에 모델은 새로운 작업의 단일 인스턴스에 대한 시연을 제시받습니다.その後 신경망은 그 새로운 작업의 새로운, 보지 못한 인스턴스에서 작업을 수행할 것으로 기대됩니다. 이 기능은 런타임 시 제공되는 별도의 시연을 기반으로 로봇이 이전에 보지 못한 새로운 작업을 수행할 수 있게 합니다.

기술적 구현 및 확장성

이 시스템은 훈련 데이터에 존재하지 않았던 조건과 작업에 일반화할 수 있도록 소프트 어텐션 메커니즘을 사용합니다.これにより 모델은 더 넓은 범위의 작업과 설정에 일반화할 수 있습니다.

OpenAI 연구자들은 모델을 더 다양한 작업과 설정에서 훈련시킴으로써 모델이 결국 어떤 시연이라도 강력한 정책으로 변환하여 엄청나게 다양한 작업을 수행할 수 있는 범용 시스템이 될 것으로 예상합니다.

Sources