OpenAI 에너지 함수로 개념 학습
OpenAI는 에너지 함수를 사용하여 에이전트가 개념을 학습하고 추출할 수 있는 방법을 도입했으며, 이를 통해 학습된 개념을 재학습 없이 완전히 다른 도메인의 작업을 해결하는 데 적용할 수 있습니다. 이 기능을 통해 에이전트는 2차원 입자 환경에서 학습한 개념을 3차원 물리 기반 로봇 환경으로 지식을 전이할 수 있습니다.
에너지 기반 개념 표현
이 접근법의 핵심은 개념을 에너지 모델로 수학적으로 표현하는 것입니다. 물리학적 직관에 기반하여, 이러한 모델은 관찰된 사건과 상태를 낮은 에너지 구성으로 간주합니다.
각 개념에 대해 에너지 함수 $E(x, a, w)$가 세 가지 구성 요소를 기반으로 정의됩니다:
- 세계의 상태 ($x$): 관찰된 환경으로, 엔티티와 그들의 속성 및 위치로 구성됩니다.
- 주의 마스크 ($a$): 모델을 특정 엔티티 집합에 집중시키는 “식별” 메커니즘입니다.
- 조건 벡터 ($w$): 에너지가 계산되는 개념을 지정하는 연속값 벡터입니다.
에너지 모델은 단일 양수 값을 출력합니다. 에너지가 0일 때 개념이 만족된 것으로 간주되며, 높은 에너지는 개념이 만족되지 않음을 나타냅니다. 만족하려면 주의 마스크가 올바른 위치에 있는 엔티티에 집중하고 올바른 엔티티가 식별되어야 합니다.
신경망 구조 및 학습
입력으로 임의 개수의 엔티티를 처리하기 위해, 에너지 함수는 관계 네트워크 아키텍처를 기반으로 한 신경망으로 구성됩니다. 학습 절차는 이 에너지 함수의 파라미터를 최적화하며, 다른 함수들은 암묵적으로 유도됩니다.
학습 과정
모델은 특정 개념에 대해 생성된 (주의 마스크, 상태) 궤적을 사용하여 학습됩니다. 학습 과정은 다음을 포함합니다:
- 시연: 모델은 주어진 개념 집합에 대해 일반적으로 다섯 개의 시연을 제공합니다.
- 예측: 새로운 환경 ($X_0$)이 주어지면, 모델은 다음 상태 ($X_1$)와 다음 주의 마스크 ($a$)를 예측합니다.
- 최적화: 에너지 함수는 학습 데이터에서 찾은 다음 상태와 다음 주의 마스크에 낮은 에너지 값을 할당하도록 최적화됩니다.
변분 오토인코더와 유사하게, 모델은 작업의 측면을 효과적으로 압축하는 값을 학습하도록 장려됩니다.
능력 및 도메인 간 전이
이 아키텍처는 단일 네트워크가 생성과 인식을 모두 수행할 수 있게 합니다. 이중 능력을 통해 모델은 생성에서 학습한 개념을 식별에, 그리고 그 반대로도 전이할 수 있습니다.
개념 유형 및 평가
시스템은 다음 유형의 개념을 포함하는 일련의 작업에서 평가되었습니다:
- 시각: 예시로 “red”(빨강) 또는 “square”(정사각형)이 있습니다.
- 공간: 예시로 “inside”(안에) 또는 “on top of”(위에)가 있습니다.
- 시간: 예시로 “slow”(느리게) 또는 “after”(후에)가 있습니다.
- 사회: 예시로 “aggressive”(공격적) 또는 “helpful”(도움이 되는)가 있습니다.
- 정량화: 양(하나, 둘, 셋, 혹은 셋 이상) 및 근접성에 대한 판단.
모델은 서로 다른 환경에서도 특정 공간 관계를 분류하고 생성하며, 장면을 특정 방식으로 탐색하는 능력을 보여주었습니다.