복잡한 목표 학습을 위한 OpenAI 반복 증폭
OpenAI는 인간 수준을 초과하는 복잡한 행동과 목표를 명시하도록 설계된 AI 안전 기술인 반복 증폭을 도입했습니다. 이 방법은 복잡한 작업을 더 간단하고 관리 가능한 하위 작업으로 분해하는 방식을 보여줌으로써 인간이 직접 수행하거나 판단할 수 없는 작업에 대해 AI 시스템을 훈련시킬 수 있게 합니다.
복잡한 작업을 위한 훈련 신호의 도전 과제
머신러닝은 성능을 평가하고 학습을 촉진하기 위해 훈련 신호—예를 들어 지도 학습의 라벨이나 강화 학습의 보상—가 필요합니다. 일부 작업은 알고리즘적인 훈련 신호(예: 바둑 경기 점수 매기기)를 갖거나 인간이 판단할 수 있지만, 많은 현실 세계 작업은 인간의 수행 능력이나 판단 능력을 초과할 정도로 복잡합니다. 예시로는 대규모 컴퓨터 네트워크의 보안 관리나 복잡한 대중교통 시스템 설계가 있습니다.
정확한 훈련 신호가 없으면 AI 시스템은 작업을 학습할 수 없으며, 더 나쁜 경우 잘못된 보상 함수 때문에 의도하지 않은 위험한 행동을 개발할 수 있습니다.
반복 증폭 작동 방식
반복 증폭은 두 가지 주요 가정에 기반해 복잡한 작업에 대한 훈련 신호를 생성합니다. 첫 번째는 인간이 큰 작업의 일부분을 구성하는 작은 구성 요소들을 식별할 수 있다는 것이고, 두 번째는 인간이 그 작업의 아주 작은 사례들을 수행할 수 있다는 것입니다.
이 과정은 반복적인 사이클을 따릅니다:
- Initial Training: 시스템은 작은 하위 작업을 샘플링하고, 이러한 소규모 문제를 해결할 수 있는 인간의 시연을 통해 훈련됩니다.
- Task Expansion: 시스템은 약간 더 큰 작업을 샘플링합니다. 인간은 이를 이전 단계에서 이미 학습된 AI가 해결할 수 있는 작은 조각들로 나누어 해결을 돕습니다.
- Direct Learning: 인간이 도와 분해한 더 어려운 작업들의 해결책을 훈련 신호로 사용하여, 인간 개입 없이 AI가 이러한 2차 수준 작업을 직접 해결하도록 훈련합니다.
- Iteration: 이 과정을 반복하여 점점 더 복합적인 작업에 대한 훈련 신호를 점진적으로 구축합니다.
성공한다면, 초기 직접 훈련 신호가 없음에도 불구하고 고도로 복합적인 작업을 해결할 수 있는 완전 자동화된 시스템이 만들어집니다.
장난감 도메인에서의 실험 결과
인간 수준을 초과하는 작업과 실제 인간 신호를 다루는 것이 프로토타입 단계에서는 복잡하기 때문에, OpenAI는 지도 학습을 사용해 다섯 가지 장난감 알고리즘 도메인에서 반복 증폭을 테스트했습니다. 이 실험에서 연구자들은 직접적인 알고리즘 해답을 모르는 척하며, 인간이 해답의 하위 조각들을 결합할 수는 있지만 직접적인 훈련 신호를 제공할 수 없는 상황을 시뮬레이션했습니다.
테스트된 다섯 가지 작업은 다음과 같습니다:
- 순열 거듭제곱
- 순차 할당
- 와일드카드 검색
- 최단 경로
- 합집합 찾기
모든 경우에서 반복 증폭은 직접적인 지도 학습과 경쟁력 있게 수행했으며, 증폭 과정이 실제 라벨에 직접 접근하지 못했음에도 불구하고 실제 라벨에 접근할 수 있는 시스템과 동일한 성능을 보였습니다.
다른 AI 안전 방법과의 관계
반복 증폭은 다른 OpenAI 안전 연구와 개념적 목표를 공유하지만 구현 방식에서는 차이가 있습니다:
- AI Safety via Debate: 두 접근 모두 반복적인 과정과 간접적인 감독을 통해 인간 능력을 초과하는 작업을 학습하려 하지만, 구체적인 방법은 다릅니다.
- Human Feedback: 반복 증폭은 보상 예측 시스템을 구현하며, 향후 버전에서는 직접적인 인간 피드백을 통합할 것으로 기대됩니다.
- Expert Iteration: AlphaGo Zero에서 사용된 방법과 유사하지만, 전문가 반복은 기존 훈련 신호를 강화하는 반면, 반복 증폭은 처음부터 훈련 신호를 구축합니다.