OpenAI 제3자 모방 학습

OpenAI는 비지도 학습 제3자 모방 학습 방법을 개발하여, AI 에이전트가 다른 관점에서 제공된 시연을 관찰함으로써 목표를 달성할 수 있게 했습니다. 이 접근 방식은 에이전트가 취해야 할 정확한 상태와 행동의 시퀀스를 제공해야 하는 제1인칭 시연의 요구 사항을 제거하여 데이터 수집 과정을 간소화합니다.

비지도 학습 제3자 모방 학습

제3자 모방 학습의 핵심 목표는 교사가 다른 관점에서 동일한 목표를 달성하는 것을 관찰한 후, 간단한 환경에서 에이전트가 해당 목표를 달성하도록 훈련하는 것입니다. 이 과정은 교사의 상태와 학생의 자신의 상태 사이에 직접적인 대응이 제공되지 않기 때문에 '비지도 학습'으로 정의됩니다. 이 방법은 전통적인 강화 학습(RL)의 주요 한계를 해결합니다. RL은 에이전트가 정교한 목표를 달성하도록 허용하지만, 정확한 보상 함수를 지정하는 것은 종종 어렵습니다. 전통적인 모방 학습은 제1인칭 시연을 사용하여これを 해결하지만, solchen 데이터를 수집하는 것은 어렵습니다. 인간처럼 학습하는 방식—다른 사람을 관찰하고 작업을 추론하는 것—을 모방함으로써, 이 방법은 에이전트가 외부 관찰로부터 학습할 수 있게 합니다.

기술적 접근: 도메인에 구애받지 않는 특징

이 방법의 주요 기술적 통찰은 도메인 혼동을 적용하여 도메인에 구애받지 않는 특징을 만드는 것입니다. 이러한 특징은 훈련 과정에서 중요합니다. 왜냐하면 교사의 관점과 에이전트 자신의 관점 사이의 간극을 메워 주어, 학습된 행동이 시연이 관찰된 관점과 무관하게 적용될 수 있도록 보장하기 때문입니다.

실험적 검증

OpenAI는 세 가지 특정 도메인에서 비지도 학습 제3자 모방 학습 접근 방식을 검증하여 그 효능을 입증했습니다:

  • Pointmass 도메인: 간단한 점 기반 환경에서 에이전트의 탐색 능력을 테스트합니다.
  • Reacher 도메인: 에이전트가 목표 위치에 도달하는 능력을 테스트합니다.
  • Inverted pendulum: 에이전트가 pendulum을 직립 위치에서 균형 잡는 능력을 테스트합니다.

Sources