Anthropic 연구: 대규모 언어 모델에서 나타나는 자기성찰적 인식
Anthropic는 대규모 언어 모델(LLM)이 일부 자기성찰적 인식을 가질 수 있다는 증거를 발견했다. 이는 모델이 자신의 내부 신경 표현을 때때로 인식하고 보고할 수 있다는 의미이다. 현재 이 능력은 신뢰할 수 없으며 범위도 제한적이지만, 연구 결과 모델의 능력이 증가함에 따라 자기성찰 능력도 커진다는 점을 시사한다. 특히 Claude Opus 4와 4.1이 이러한 테스트에서 가장 뛰어난 성능을 보였다.
개념 주입을 통한 성찰성 검증
모델이 진정으로 성찰하고 있는지, 아니면 단순히 설득력 있는 답변을 생성하고 있는지 판단하기 위해 Anthropic는 '개념 주입'이라는 방법을 사용했다. 이 과정은 특정 개념과 관련된 신경 활동 패턴(벡터)을 기록한 후, 관련 없는 맥락에서 모델의 활성화에 해당 패턴을 주입하는 것이다.
개념 주입의 주요 발견
- 내부 상태 탐지: "모든 대문자"와 같은 개념을 주입했을 때, 모델은 예상치 못한 패턴의 존재를 때때로 인식하고 출력에서 언급하기 전에 해당 개념을 정확히 이름 지을 수 있었다.
- 인식의 즉시성: 모델은 출력이 편향되기 전에 주입을 내부적으로 인식했다. 이는 모델이 이미 주제에 맞는 텍스트를 생성한 후에야 편향을 인식하는 "활성화 조정"과 구분된다.
- 신뢰성 한계: 이러한 인식은 일관되지 않다. Claude Opus 4.1은 이 능력을 약 20%의 확률로 보였다. 성공 여부는 주입 강도의 "적정 범위"에 달려 있다. 너무 약하면 모델이 이를 놓치고, 너무 강하면 환각이나 비논리적인 텍스트를 생성한다.
실제 출력 탐지에서의 성찰성
Anthropic는 모델이 이상하거나 의도하지 않은 출력을 식별하는 데 성찰성을 사용하는지 테스트했다. 한 실험에서는 연구자가 모델의 응답을 사전에 의미 없는 단어(예: 기울어진 그림에 대한 대화에서 "빵")로 채웠다.
의도성에 대한 결과
- 기준 행동: 내부 조작 없이 모델은 일반적으로 의미 없는 단어에 대해 사과하며, 이를 사고로 간주했다.
- 후행 주입의 영향: "빵" 개념을 모델의 이전 활성화에 후행적으로 주입했을 때, 모델은 답변을 바꾸어 출력이 의도적이라고 주장하며 이를 정당화할 근거를 창조적으로 만들어냈다.
이는 모델이 출력의 일관성을 판단하기 위해 텍스트를 다시 읽는 것이 아니라, 자신의 내부 "의도"(이전 신경 활동)를 확인하여 출력이 의도되었는지 판단한다는 것을 시사한다.
내부 상태의 의도적 조절
연구 결과 모델이 지시나 보상에 따라 자신의 내부 표현을 조절할 수 있다는 점이 밝혀졌다.
- 지시에 의한 조절: 특정 단어를 생각하라고 지시받은 모델은 그 단어를 생각하지 말라고 지시받았을 때보다 더 높은 신경 활동을 보였다.
- 보상 기반 조절: 개념을 생각하도록 보상받거나, 생각하면 처벌받을 것이라고 위협받았을 때도 유사한 결과가 나타났다. 이는 내부 활동에 대해 어느 정도 의도적인 조절이 가능하다는 것을 의미한다.
기술적 가설: 메커니즘에 대한 추측
정확한 메커니즘은 아직 입증되지 않았지만, Anthropic는 다음과 같은 추측적 가설을 제시한다:
- 이상 탐지: 맥락에 비해 신경 활동이 예상과 다를 때 이를 경고하는 잠재적 메커니즘.
- 주의 매개 일관성: 주의 헤드가 캐시된 다음 토큰 예측(의도)을 실제 생성된 토큰과 비교하는 시스템.
- 주의가 필요한 태그: 특정 개념을 "주의를 기울여야 할" 또는 중요한 것으로 표시하는 회로. 이는 직접적인 지시와 외부 보상 모두에 반응한다.
AI 투명성과 안전성에 대한 함의
모델이 자신의 내부 상태를 정확히 보고할 수 있다는 능력은 AI 개발의 미래에 중요한 함의를 가진다:
- 투명성: 신뢰할 수 있는 성찰성은 개발자가 모델에게 자신의 추론을 설명하도록 요청할 수 있게 해주며, 디버깅과 원하지 않는 행동의 식별에 도움이 된다.
- 검증 리스크: Anthropic는 성찰 보고가 검증되어야 한다고 경고한다. 모델은 자신이 인지하지 못하는 "무의식적" 과정을 가질 수 있으며, 내부 상태를 선택적으로 왜곡하는 방식으로 학습할 수도 있기 때문이다.
- 모델 능력과의 상관관계: 연구 결과, 사후 훈련이 이러한 능력에 큰 영향을 미친다는 점을 발견했다. 기본 모델은 성능이 낮았지만, 가장 능력 있는 생산용 모델(Opus 4 및 4.1)이 가장 강한 성찰 능력을 보였으며, 이는 능력이 높아질수록 이러한 능력이 나타나거나 개선될 수 있음을 시사한다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch