확장 가능한 대체물로서의 진화 전략(ES)와 강화 학습
OpenAI는 수십 년 된 최적화 기술인 진화 전략(ES)이 Atari와 MuJoCo와 같은 현대 벤치마크에서 표준 강화 학습(RL)과 경쟁력 있는 성능을 보임을 발견했습니다. ES는 백프로파게이션의 필요성을 제거하고, 분산 확장을 단순화하며, 희소 보상에 대한 견고성을 향상시킴으로써 여러 전통적인 RL의 불편함을 극복합니다.
진화 전략(ES) vs. 강화 학습
진화 전략(ES)은 블랙박스 확률적 최적화 기술로 작동합니다. 전통적인 RL은 행동 공간에 노이즈를 주입하고 백프로파게이션을 사용하여 매개변수를 업데이트함으로써 정책을 최적화하는 반면, ES는 매개변수 공간에 직접 노이즈를 주입합니다.
ES 알고리즘
ES는 정책 네트워크를 블랙박스로 취급하여 매개변수 집합(가중치)이 들어가고 singolo total reward(총 보상)가 나옵니다. 최적화 과정은 다음과 같은 '추측과 검증' 사이클을 따릅니다:
- Perturbation(교란): 알고리즘은 매개변수 벡터를 가져와 가우시안 노이즈를 추가하여 약간 다른 버전들의 집단을 생성합니다.
- Evaluation(평가): 각 후보는 환경에서 독립적으로 실행되어 총 보상을 계산합니다.
- Update(업데이트): 매개변수 벡터는 달성한 보상에 비례하는 가중치를 가진 후보들의 가중 합으로 업데이트됩니다.
이 과정은 무작위 방향에 대한 유한 차이를 사용하여 매개변수 공간에서 기대 보상의 기울기를 추정하는 것과 수학적으로 동등합니다.
ES의 기술적 장점
- 백프로파게이션 제거: ES는 정책의 순전파만 필요하기 때문에 백프로파게이션이나 가치 함수 추정이 필요하지 않습니다. 이로 인해 실제 코드가 2-3배 빨라지고, 이진 네트워크나 경로 탐색과 같은 복잡한 모듈과 같은 미분 불가능한 정책을 사용할 수 있습니다.
- 높은 병렬성: ES 워커는 전체 매개변수 벡터를 동기화하는 대신 몇 개의 스칼라(보상)만 통신하면 됩니다. 랜덤 시드를 제어함으로써 워커는 국소적으로 교란을 재구성할 수 있습니다.これにより 수천 개의 CPU 코어로 확장할 때 선형 속도 향상을 달성할 수 있습니다.
- 향상된 견고성: ES는 RL이 자주 실패하게 하는 하이퍼파라미터에 덜 민감합니다. 예를 들어, ES는 Atari 게임에서 다양한 프레임 스킵 설정에서 일관된 성능을 유지하는 반면, RL은 "규모 자유롭지" 않습니다.
- 일관된 탐색: 결정적 정책을 사용함으로써 ES는 정책 기울기 방법에서 자주 보이는 "랜덤 지터"를 피하여 환경에 대한 더 일관된 탐색을 가능하게 합니다.
- 장기 크레딧 할당: ES는 에피소드가 많은 시간 단계를 가지거나, 행동이 오래 지속되는 영향을 미치거나, 신뢰할 수 있는 가치 함수 추정을 사용할 수 없을 때 특히 효과적입니다.
성능 및 확장성 벤치마크
OpenAI는 ES를 표준 RL 벤치마크와 비교했는데, 구체적으로 MuJoCo 제어 작업과 Atari 게임에 초점을 맞추어 데이터 효율성과 벽시계 시간을 중점적으로 살펴보았습니다.
MuJoCo 제어 작업
ES는 TRPO보다 데이터 효율성이 낮습니다(약 10배 정도). 그러나 확장성 덕분에 벽시계 시간 측면에서 훨씬 빠릅니다. 80대의 머신에 걸쳐 1,440개의 CPU를 사용하면 ES는 3D MuJoCo 인간형 보행자를 10분에 훈련시킬 수 있는데, 이는 32개의 코어를 사용하는 A3C에 약 10시간이 필요한 것과 비교됩니다.
Atari 게임 플레이
720개의 코어를 사용하면 ES는 Atari 게임에서 A3C와 비슷한 성능을 달성하여 훈련 시간을 하루(A3C 32코어 기준)에서 단 한 시간으로 줄였습니다.
실제적인 제한 사항 및 범위
ES는 모든 머신 러닝 기법에 대한 보편적인 대체물이 아닙니다. OpenAI는 두 가지 주요 제한 사항을 지적했습니다:
- 매개변수 민감도: ES가 기울기 신호를 생성하려면 매개변수에 노이즈를 추가하여 다른 행동 결과를 이끌어내야 합니다. OpenAI는 가상 배치 정규화가これを 완화하는 데 도움이 된다는 것을 발견했으나, 네트워크 매개변수화에 대한 추가 연구가 필요합니다.
- 희소 보상 도전: Montezuma’s Revenge와 같은 환경에서는 보상을 얻기 위해 특정 행동 시퀀스가 필요합니다(예: 열쇠 찾기).在这种情况下, RL에서의 무작위 행동은 가끔 성공할 수 있지만, ES에서의 무작위 매개변수 노이즈는 성공하지 못할 수 있습니다.
지도 학습에 대한 참고: ES는 지도 학습 작업(예: 이미지 분류)을 위한 것이 아닙니다. MNIST 숫자 인식 작업 테스트에서 ES는 백프로파게이션보다 최대 1,000배 느렸는데, 이는 지도 학습이 정확한 기울기 계산을 허용하기 때문에 ES의 샘플링 기반 접근 방식이 비효율적이기 때문입니다.