Anthropic의 중첩(Superposition) 토이 모델 연구

Anthropic은 신경망이 가용한 차원보다 더 많은 수의 특징(features)을 어떻게 표현하는지 조사하는 "Toy Models of Superposition"이라는 연구 프로젝트를 소개했습니다. 중첩(superposition)이라고 불리는 이 현상은 입력 특징이 희소(sparse)하다면 모델이 선형 모델보다 정보를 더 효율적으로 압축할 수 있게 해줍니다.

중첩의 메커니즘

중첩은 모델이 차원이 허용하는 것보다 더 많은 특징을 표현할 때 발생합니다. 토이 모델—구체적으로 희소한 입력 특징을 가진 합성 데이터로 학습된 작은 ReLU 네트워크—에서 Anthropic 연구원들은 모델이 단일 차원에 여러 특징을 저장할 수 있음을 발견했습니다. 이러한 압축은 특징을 공간상의 방향으로 취급함으로써 달성되며, 이는 모델이 이러한 특징들 사이의 충돌을 해결하기 위해 학습하는 전략입니다.

희소성과 비선형성의 역할

희소성은 중첩을 위한 필수 요구 사항입니다. 입력 특징이 희소할 때(즉, 한 번에 몇 가지만 활성화될 때), 모델은 은닉층에 더 많은 특징을 채워 넣을 수 있습니다. 그러나 이러한 압축에는 비용이 따릅니다: 특징 간의 "간섭(interference)"입니다.

이 간섭을 해결하기 위해 모델은 비선형 필터링을 활용합니다. ReLU (Rectified Linear Unit) 활성화 함수에서, 모델은 다른 특징의 간섭으로 인해 발생하는 노이즈를 걸러낼 수 있으며, 이를 통해 압축된 표현 방식에도 불구하고 동일한 특징을 효과적으로 분리해낼 수 있습니다.

모델 해석 가능성에 대한 시사점

중첩 토이 모델에 대한 연구는 모델의 내부 표현이 어떤 특징이 활성화되어 있는지에 대한 일대일 매핑이 반드시 아닐 수도 있음을 시사합니다. 이는 복잡한 모델의 내부 상태가 모델의 너비보다 훨씬 더 많은 수의 특징을 표현할 수 있음을 의미하며, 이는 모델의 내부 가중치가 어떻게 뉴런이 특정 개념을 나타내는지 이해하는 과정을 복잡하게 만듭니다.

Sources

관련