OpenAI Teacher–Student Curriculum Learning
OpenAI는 복잡한 작업에 대한 훈련 커리큘럼 생성을 자동화하기 위해 설계된 프레임워크인 Teacher–Student Curriculum Learning (TSCL)을 도입했습니다. "Teacher" 알고리즘을 사용하여 "Student" 모델을 위한 하위 작업을 동적으로 선택함으로써, TSCL은 직접적인 훈련이나 균등한 샘플링을 통해서는 학습이 불가능한 문제를 에이전트가 해결할 수 있도록 합니다.
TSCL 프레임워크
Teacher–Student Curriculum Learning은 복잡한 작업을 사용 가능한 하위 작업 세트로 분할하여 작동합니다. 이 프레임워크는 두 가지 주요 구성 요소로 이루어져 있습니다:
- The Student: 복잡한 대상 작업을 학습하려고 시도하는 모델.
- The Teacher: 주어진 세트에서 Student가 특정 시점에 어떤 하위 작업을 훈련해야 할지 자동으로 선택하는 알고리즘.
Teacher 알고리즘 로직
TSCL의 Teacher 알고리즘은 학습 과정을 최적화하기 위해 두 가지 주요 직관에 의해 유도됩니다:
- 진보 극대화 (Maximizing Progress): Teacher는 학습 곡선의 기울기가 가장 높은 지점으로 식별되는, Student가 가장 빠르게 진보를 보이고 있는 하위 작업을 우선시합니다.
- 망각 방지 (Preventing Forgetting): 치명적 망각(catastrophic forgetting) 문제를 해결하기 위해, Teacher는 Student의 성능이 활발히 저하되고 있는 하위 작업도 선택합니다.
실험 결과 및 성능
OpenAI는 두 가지 서로 다른 작업, 즉 Long Short-Term Memory (LSTM) 네트워크를 사용한 소수점 숫자 덧셈과 Minecraft 내 내비게이션을 통해 TSCL의 효과를 입증했습니다.
Minecraft 내비게이션
Minecraft 미로 내비게이션에서 TSCL은 베이스라인 훈련 방법보다 상당한 이점을 보여주었습니다:
해결 불가능한 작업 해결: 자동으로 생성된 커리큘럼 덕분에 모델은 최종 목표에 대해 직접 훈련할 때는 전혀 해결할 수 없었던 Minecraft 미로를 해결할 수 있었습니다.
훈련 효율성: 학습 속도가 하위 작업의 균등 샘플링을 사용할 때보다 한 자릿수(an order of magnitude) 더 빨랐습니다.
소수점 덧셈
소수점 숫자를 더하는 작업에서 TSCL은 정교하게 수작업으로 제작된 커리큘럼이 달성한 결과와 대등하거나 이를 능가했으며, 이는 자동화된 시스템이 수동 커리큘럼 설계의 필요성을 대체할 수 있음을 증명합니다.
자동 커리큘럼 학습에 대한 시사점
TSCL은 실시간 성능 지표를 기반으로 훈련 데이터의 난이도와 초점을 동적으로 조정함으로써 자동 커리큘럼 학습이 수동 설계를 능가할 수 있음을 보여줍니다. 빠른 진보의 추구와 이전에 학습한 기술의 유지 사이에서 균형을 맞춤으로써, 이 프레임워크는 복잡한 다단계 작업에 대해 모델을 훈련시키는 확장 가능한 접근 방식을 제공합니다.