Anthropic 연구: 중첩(Superposition), 암기(Memorization), 그리고 이중 하강(Double Descent)
Anthropic 연구원들은 단순한 신경망이 특히 제한된 데이터셋을 암기할 때, 가용 뉴런 수보다 더 많은 특징(features)을 표현하기 위해 중첩(superposition)을 사용할 수 있음을 확인했습니다. 이 발견은 중첩이 모델이 과적합(overfitting)되고 특정 사례를 암기하는 방식의 핵심 메커니즘임을 시사하며, 이는 기계론적 해석 가능성(mechanistic interpretability)을 달성하는 데 매우 중요합니다.
암기에서 중첩의 역할
중첩은 신경망이 그 차원(뉴런의 수)이 허용하는 것보다 더 많은 특징을 표현할 때 발생합니다. 텍스트를 그대로 암기하는 언어 모델의 경우, 네트워크는 암기된 시퀀스당 하나의 뉴런을 사용하는 비효율적인 방식을 피할 수 있습니다. 대신, 중첩을 활용하여 이러한 상호 배타적인 사례들을 단일 뉴런 또는 뉴런 세트에 저장함으로써, 서로 다른 암기된 시퀀스 간의 간섭을 방지합니다.
기계론적 해석 가능성과 과적합
기계론적 해석 가능성은 딥러닝 모델의 내부 작동 방식을 이해하는 것을 목표로 합니다. Anthropic의 연구는 머신러닝의 핵심 문제인 과적합과 해석 가능한 특징을 학습하는 것 사이의 연결 고리가 있음을 나타냅니다. 현재 모델이 과적합되거나 암기할 때 어떤 일이 발생하는지에 대한 기계론적 이해가 거의 없기 때문에, 토이 모델(toy models)에서 이러한 현상을 연구하는 것은 복잡한 모델이 학습 과정 중에 어떻게 행동하는지 이해하기 위한 필수적인 토대를 제공합니다.
토이 모델 조사
Anthropic은 이전 연구에서 사용된 것과 동일한 토이 모델을 제한된 데이터셋으로 학습시켜 예비 조사를 수행했습니다. 이 연구는 초점을 무한한 데이터의 과소적합(underfitting) 영역에서 과적합이 발생하는 제한된 데이터의 사례로 전환했습니다. 이러한 단순화된 모델에서도 연구팀은 토이 모델이 중첩과 모델의 데이터 암기 능력 사이의 관계를 이해하기 위한 풍부한 사례 연구 역할을 한다는 것을 발견했습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch