Anthropic Golden Gate Claude 해석 가능성 데모

Anthropic은 대규모 언어 모델의 내부 활성화를 정밀하게 수정하여 동작을 변경할 수 있는 능력을 입증했습니다. Claude 3 Sonnet 내에서 Golden Gate Bridge와 관련된 특정 "feature"를 증폭시킴으로써, Anthropic은 프롬프트와 관계없이 거의 모든 응답에 다리를 포함시키는 연구 데모인 "Golden Gate Claude"를 만들었습니다.

정밀한 Feature 조작 vs. 전통적인 튜닝

Anthropic의 모델 동작 수정 방식은 입력이나 학습 과정을 변경하는 것이 아니라, 내부 활성화를 정밀하게 수정하는 방식입니다. 이 방법은 세 가지 일반적인 AI 수정 기술과 다릅니다:

  • System Prompting: 모델에게 특정 페르소나를 연기하도록 지시하기 위해 입력에 추가 텍스트를 더하는 방식에 의존하지 않습니다.
  • Play-acting: 모델에게 말로 역할을 채택하도록 요청한 결과가 아닙니다.
  • Fine-tuning: 기존 모델의 동작을 미세하게 조정하는 새로운 "black box"를 만들기 위해 추가 학습 데이터를 사용하는 전통적인 fine-tuning 방식이 아닙니다.

"Feature"의 메커니즘

Claude 3 Sonnet의 "마음" 속에서, Anthropic은 "feature"라고 알려진 수백만 개의 개념을 식별했습니다. 이러한 feature들은 모델이 관련 텍스트나 이미지를 접할 때 활성화되는 신경망 내 뉴런의 특정 조합입니다.

이러한 활성화 강도를 높이거나 낮춤으로써, 연구자들은 모델의 동작에서 그에 상응하는 변화를 식별할 수 있습니다. Golden Gate Claude의 경우, "Golden Gate Bridge" feature가 최대 활성화 값의 10배로 고정되어, 모델이 거의 모든 질의에서 다리에 집중하도록 유도했습니다. 예를 들어, 모델은 10달러를 어떻게 쓸지 물었을 때 Golden Gate Bridge 통행료를 내는 것을 추천하거나, 자신의 외형에 대해 물었을 때 다리처럼 생겼다고 설명했습니다.

AI 안전을 위한 시사점

Anthropic은 이러한 내부 feature를 찾아내고 수정할 수 있는 능력이 대규모 언어 모델이 실제로 어떻게 작동하는지에 대한 더 깊은 이해를 가능하게 한다고 밝히고 있습니다. 이 능력은 AI 안전에 직접적인 영향을 미치며, 동일한 기술을 사용하여 안전 관련 feature를 조작할 수 있기 때문입니다.

구체적으로, 이 연구는 다음과 관련된 feature의 수정을 가능하게 합니다:

  • 위험한 컴퓨터 코드
  • 범죄 활동
  • 기만

Anthropic은 이러한 내부 활성화에 대한 추가 연구가 연구자들이 모델이 사용하는 내부 개념을 실제로 보고 제어할 수 있게 함으로써 AI 모델을을 더 안전하게 만드는 데 도움이 될 것이라고 믿습니다.

Sources

관련