Anthropic 연구: 대규모 생성 모델의 예측 가능성과 놀라움
Anthropic 연구에 따르면 GPT-3, Megatron-Turing NLG, Gopher와 같은 대규모 생성 모델은 광범위한 훈련 분포에서의 예측 가능한 손실(loss)과 예측 불가능한 특정 능력, 입력 및 출력의 조합이라는 직관에 반하는 특성을 보입니다.
스케일링 법칙과 창발적 능력 사이의 긴장 관계
대규모 사전 훈련은 개발자가 스케일링 법칙에 기반하여 모델 성능(손실)을 예측할 수 있게 해줍니다. 손실의 높은 수준의 예측 가능성은 이러한 모델의 급격한 발전을 이끌지만, 이것이 특정 행동의 예측 가능성으로 이어지지는 않습니다.
모델 개발자는 일반적인 관점에서 모델이 얼마나 개선될지 예상할 수 있지만, 어떤 특정 능력이 창발할지 또는 모델이 특정 입력에 어떻게 반응할지 쉽게 예측할 수 없습니다. 일반적인 성능 트렌드와 특정 행동의 예측 불가능성 사이의 이러한 격차는 이러한 모델을 배포할 때의 결과를 예상하기 어렵게 만듭니다.
리스크와 정책적 시사점
대규모 생성 모델의 예측 불가능성은 AI 안전 및 정책에 중대한한 과제를 제기합니다. 특정 능력과 출력이 예측 불가능하기 때문에, 모델은 배포 전에는 감지하기 어려운 사회적으로 해로운 행동을 보일 수 있습니다.
Anthropic은 예측 가능한 스케일링과 예측 불가능한 행동이라는 이러한 상충하는 특성이 모델을 배포하려는 개발자의 동기와 안전한 배포를 방해하는 과제들에 영향을 미준다고 언급합니다. 연구는 출력의 예측 불가능성이 모델이 모든 사용자에게 유익하고 안전할 것임을 보장하기 어렵게 만든다는 점을 강조합니다.
AI 안전을 위한 제안된 개입
예측 불가능한 창발적 능력과 관련된 리스크를 완화하기 위해, Anthropic은 AI 커뮤니티가 대규모 생성 모델이 유익한 영향을 미칠 가능성을 높이기 위한 개입을 구현해야 한다고 제안합니다. 이 연구는 정책 입안자, 기술자, 그리고 범용 학계 전문가들이 AI 시스템을 더 효과적으로 이해하고 규제할 수 있도록 돕는 리소스로 의도되었습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch