OpenAI 가르침을 통한 해석 가능한 머신 러닝
OpenAI는 개념 인식을 위한 인간 해석 가능한 언어를 만들어 컴퓨터와 인간이 협업할 수 있도록 하는 머신 교수법을 개발했습니다. 이 방법은 교사 네트워크와 학생 네트워크 간의 협력 게임을 사용하여 학생이 목표 개념을 올바르게 추측할 수 있도록 하는 가장 작은 집합의 설명적인 예시를 식별합니다.
교사-학생 프레임워크
이 접근 방식의 핵심은 교사 네트워크가 학생 네트워크가 특정 개념(예: "dog" 또는 "zebra))을 추측하도록 돕는 예시를 선택하는 협력 게임입니다. 목표는 교사가 학생의 이해를 돕기 위해 가능한 가장 설명적인 예시를 선택하도록 학습하는 것입니다.
두 단계 훈련 과정
결과 예시가 인간에게 해석 가능하도록 유지하기 위해, OpenAI는 두 단계 기법을 사용합니다:
- 학생 훈련: 학생 신경망은 먼저 무작위로 선택된 입력 예시를 사용하여 전통적인 지도 학습 방법을 통해 올바른 개념 레이블을 추측하도록 훈련됩니다.
- 교사 최적화: 개념과 예시를 연결하는 레이블에 접근할 수 있는 교사 네트워크는 학생에게 다양한 예시를 테스트합니다. 교사는 학생이 의도한 개념을 올바르게 식별하는 데 필요한 가장 작은 예시 집합으로 수렴합니다.
공모와 임의적 인코딩 방지
훈련 단계를 분리함으로써 이 방법은 두 네트워크가 인간에게 해석 불가능한 사적인 언어를 개발하는 것을 방지합니다. 공동 훈련—학생과 교사가 동시에 훈련되는 경우—네트워크는 종종 임의의 벡터나 인간이 이해하기 어려운 예시를 통해 통신하기 위해 공모합니다. 예를 들어, "dog" 개념은 라마와 오토바이 이미지를 통해 인코딩될 수 있으며, 직사각형의 치수는 두 개의 무작위처럼 보이는 점을 통해 인코딩될 수 있습니다.
실제 적용: 개념 인식
기법의 효과를 입증하기 위해, OpenAI 연구진은 크기(작음, 중간, 큼), 색상(빨강, 파랑, 초록), 모양(정사각형 대 원), 테두리(실선 대 없음)라는 네 가지 속성에 따라 달라지는 예시를 사용했습니다.
이 경우, 개념은 예시의 부분집합을 정의하는 속성 집합으로 정의됩니다. 교사 네트워크는 개념에 필요한 속성만 공유하는 예시를 선택하도록 학습하여, 학생이 관련 없는 속성을 배제할 수 있게 합니다.
예시: "red" 개념 가르치기
"red" 개념을 인식하도록 학생을 가르치기 위해, 교사는 테두리가 없는 큰 빨간 정사각형과 테두리가 있는 작은 빨간 원이라는 두 가지 특정 예시를 선택합니다. 이 두 도형 사이의 유일한 공통 속성은 색상 빨강이므로, 학생은 논리적으로 개념이 색상 빨강으로 정의됨을 결론지을 수 있습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch