OpenAI 딥 더블 디센트
OpenAI는 CNN, ResNet, 트랜스포머를 포함한 다양한 딥러닝 아키텍처에서 더블 디센트 현상이 발생함을 보여주었다. 이 행동은 모델 크기, 데이터 크기, 또는 학습 시간이 증가함에 따라 모델 성능이 처음에는 개선되었다가 악화되었다가 다시 개선되는 패턴으로 나타난다.
모델별 더블 디센트
테스트 오류는 모델 크기가 증가함에 따라 단조로운 경로를 따르지 않으며, 대신 '더블 디센트' 패턴을 보인다. 신경망의 파라미터 수가 증가함에 따라 테스트 오류는 처음에는 감소했다가 피크로 증가한 후, 모델이 훈련 세트에 충분히 맞출 수 있을 정도로 커지면 두 번째 하강을 겪는다.
이 테스트 오류의 피크는 '임계 영역' 또는 보간 임계값에서 발생하며, 이때 모델은 훈련 데이터를 정확히 맞출 수 있을 정도로 barely 충분히 크다. 이 보간 임계값을 이동시키는 요인들—예를 들어 최적화 알고리즘의 변화, 훈련 샘플의 수, 또는 레이블 노이즈의 양—은 테스트 오류 피크의 위치도 이동시킨다. 이 현상은 데이터셋에 레이블 노이즈가 추가될 때 가장 두드러지며, 이는 피크를 증폭시키고 관측을 용이하게 한다.
샘플별 비단조성
훈련 데이터의 양을 늘리는 것이 특정 영역에서는 테스트 성능을 악화시킬 수 있다. 더 많은 샘플을 추가하는 것은 일반적으로 전체 오류 곡선을 아래로 이동시키지만, 동시에 보간 임계값과 관련된 테스트 오류 피크를 오른쪽으로 이동시키는데,这是因为更大的模型才能拟合更大的数据集。
对于中等模型规模,这两种效应可以结合形成一个区域,在这个区域中,使用更多数据进行训练实际上会损害性能。在一个涉及在语言翻译任务上训练的变换器的观察案例中,使用4.5倍更多的样本进行训练导致某些模型规模的测试性能变差。
에포크별 더블 디센트
모델을 더 오래 훈련시키면 과대적합을 역전시킬 수 있다. 고정된 모델 크기에 대해 최적화 단계가 진행됨에 따라 테스트 오류와 훈련 오류는 감소했다가 증가했다가 다시 감소할 수 있다.これをエポークワイズ・ダブルディセントと呼ぶ。
모델 크기와 최적화 단계 전반에 걸쳐 테스트 오류의 피크는 모델이 훈련 세트를 barely 맞출 수 있을 때 일관되게 나타난다.
이론적 직관과 미해결 질문
OpenAI는 보간 임계값에서 효과적으로 훈련 데이터를 fitting하는 모델이 하나뿐이라고 제안한다. 이 단일 모델을 노이즈가 있거나 misspecified된 레이블에 맞추도록 강제하면 그 글로벌 구조가 파괴되어, 훈련 세트를 보간하면서도 테스트 세트에서 잘 수행할 수 있는 '좋은 모델'이 남지 않는다.
그러나 과매개변수화된 영역에서는 많은 모델이 훈련 세트를 fitting할 수 있다. 확률적 경사 하강법(SGD)의 편향은 최적화 과정이 일반화 성능이 좋은 '좋은 모델'쪽으로 이끌 것이라고 믿어지지만, 정확한 메커니즘은 여전히 미해결 연구 문제로 남아 있다.
신중한 정규화와 조기 종료는 더블 디센트 피크를 피하는 일반적인 방법으로 언급된다.
Sources
- OriginalDeep double descent