Anthropic 연구: 영향 함수를 사용한 모델 출력에서 훈련 데이터 추적하기

Anthropic는 최대 520억 파라미터를 가진 대규모 언어 모델(LLM)에 영향 함수를 확장하는 방법을 개발하여, 특정 모델 출력이 가장 영향력 있는 훈련 예제로 이어지는 경로를 추적할 수 있게 했습니다. 이 연구는 모델 규모가 커질수록 모델이 표면적인 토큰 겹침에 의존하는 방식에서 추상적이고 주제적인 개념을 통해 일반화하는 방식으로 전환됨을 보여줍니다.

대규모 모델에 영향 함수 확장하기

영향 함수는 특정 훈련 예제가 모델 출력에 가장 크게 기여하는지를 판단하기 위한 통계 기법으로, 이를 반사적 시나리오로 간주합니다. 즉, 특정 훈련 예제가 데이터셋에 추가되었을 때 모델의 파라미터와 출력이 어떻게 변할지를 계산하는 방식입니다.

과거에는 이 과정이 대규모 모델에 대해 계산적으로 불가능했으며, 모든 후보 훈련 예제에 대해 역헤시안-벡터 곱과 기울기를 계산해야 했습니다. Anthropic의 연구는 "영향 함수를 통한 대규모 언어 모델 일반화 연구" 논문에서 다루고 있는 효율적인 알고리즘을 도입함으로써, 8억 1천만에서 520억 파라미터까지 다양한 규모의 모델에서 이러한 분석을 가능하게 했습니다.

모델 규모와 일반화의 관계

연구 결과에 따르면, 모델 규모가 커질수록 일반화 패턴이 더 추상화됩니다. 이 전환은 다양한 규모의 모델이 영향력 있는 훈련 시퀀스를 어떻게 식별하는지에서 확인할 수 있습니다:

  • 작은 모델 (예: 8억 1천만 파라미터): 영향력 있는 시퀀스는 종종 겹치는 토큰이나 특정 단어(예: "기존 상태를 계속 유지" 또는 단어 "clip")를 공유하지만, 출력과는 의미적으로 관련이 없습니다.
  • 큰 모델 (예: 520억 파라미터): 영향력 있는 시퀀스는 출력과 더 개념적으로 관련이 있습니다. 예를 들어, 모델이 종료되지 않기를 원한다는 표현을 할 때, 520억 파라미터 모델의 영향력 있는 시퀀스는 단순한 키워드 매칭이 아니라, AI의 생존 본능과 인간과 유사한 감정에 대한 주제를 다룹니다.

이 경향은 수학 단어 문제에 대한 사고 과정 체인에서도 관찰됩니다. 더 큰 모델은 비슷한 추론 과정을 설명하는 훈련 예제에 의존하는 반면, 표면적인 어휘를 공유하는 예제에 의존하지 않습니다.

다국어 영향과 일반화

모델 규모는 영향이 언어 간 전이되는 방식에도 영향을 미칩니다. 질문(예: 종료 반대 예시)을 한국어와 터키어로 번역했을 때, 연구자들은 모델 규모가 커질수록 영어 훈련 시퀀스가 번역된 질문에 미치는 영향이 상당히 강해지는 것을 발견했습니다. 이는 더 큰 모델이 정보에 대해 더 언어에 구애받지 않는 추상적 이해를 갖게 된다는 것을 시사합니다.

기억과 일반화의 구분

영향 패턴 분석 결과, LLM의 출력이 순수한 토큰 수준의 기억에 기반하지 않는다는 것이 드러났습니다. 연구자들은 다음과 같은 사실을 발견했습니다:

  • 분포: 영향은 일반적으로 멱법칙 분포를 따릅니다. 즉, 훈련 데이터의 소수 부분이 대부분의 영향을 제공합니다.
  • 확산: 멱법칙에도 불구하고 영향은 여전히 확산되어 있습니다. 어떤 단일 훈련 시퀀스의 영향은 일반적인 문장의 정보량보다 작으며, 이는 모델이 단순히 개별 훈련 예제를 외우고 있는 것이 아님을 나타냅니다.

네트워크 내에서 영향 지역화하기

영향 함수는 영향이 신경망 아키텍처의 어디에 분포되어 있는지를 맵핑하는 데 사용할 수 있습니다. 평균적으로 영향은 레이어 간에 약간 균등하게 분포하지만, 특정 질의에서는 지역화가 나타납니다:

  • 하단 및 상단 레이어: 이 레이어들은 구체적인 어휘와 특정 토큰 정보를 포착하는 경향이 있습니다.
  • 중간 레이어: 이 레이어들은 일반화를 더 추상적이고 주제적인 수준에서 처리합니다.

AI 정렬 및 해석 가능성에 대한 함의

이 상향식 해석 가능성 접근법은 하향식 기계적 해석 가능성(개별 유닛과 회로를 연구하는 방식)과 보완됩니다. 관측 가능한 행동에서 시작하여 책임 있는 뉴런과 회로로 내려가면서, 연구자들은 규모가 커질 때만 나타나는 추론과 역할 수행과 같은 고차원 인지 현상을 연구할 수 있습니다. Anthropic는 이 연구를 미세 조정(fine-tuning)에 확장할 계획이며, 이는 감독 학습과 강화 학습 목표가 모델 정렬과 행동에 어떻게 영향을 미치는지를 이해하는 데 필수적입니다.

Sources

관련