Anthropic 해석 가능성 연구 개요
Anthropic의 Interpretability 팀은 AI 안전성을 보장하고 긍정적인 결과를 도출하기 위해 대규모 언어 모델(LLMs)의 내부 메커니즘을 발견하고 이해하는 데 전념하고 있습니다. 모델의 동작을 상세히 설명함으로써, 팀은 편향성, 오용, 자율적인 유해 행동을 포함한 중요한 안전 문제를 해결하는 것을 목표로 합니다.
안전을 위한 기초로서의 내부 모델 이해
신경망의 내부 상태를 이해하는 것은 그 안전성에 대해 추론하는 데 필수적입니다. Anthropic의 접근 방식은 대규모 언어 모델의 특정 동작을 설명하여 블랙박스 운영을 넘어선다는 것에 초점을 맞추고 있으며, 이를 통해 연구자들이 편향성 및 자율적인 유해 행동 방지 관련 문제를 해결할 수 있도록 합니다.
다학제적 연구 접근 방식
Anthropic은 머신러닝, 천문학, 물리학, 수학, 생물학, 데이터 시각화 분야의 배경을 가진 연구자들로 구성된 다학제적 팀을 고용하고 있습니다. 이 팀에는 scaling laws 논문에 기여한 인물들과 mechanistic interpretability를 시작한 것으로 인정받는 연구자들과 같은 해당 분야의 핵심 인물들이 포함되어 있습니다.
주요 연구 분야 및 출판물
Anthropic은 모델 내부의 다양한 측면에 초점을 맞춘 연구 궤적을 발표해 왔으며, 여기에는 다음이 포함됩니다:
- Cognitive Architecture: 언어 모델 내의 "global workspace"에 대한 연구 (2026년 7월).
- Textualization of Internal States: 모델의 "생각"을 텍스트로 변환하기 위한 Natural Language Autoencoders 개발 (2026년 5월).
- Emotion and Persona: 감정 개념 및 그 기능에 대한 연구 (2026년 4월), 그리고 성격 특성을 모니터링하고 제어하기 위한 persona vectors 연구 (2025년 8월).
- Model Comparison and Stability: 새로운 모델의 동작 차이를 찾기 위한 "diff" 도구 제작 (2026년 3월) 및 모델 성격을 안정화하기 위한 assistant axis 연구 (2026년 1월).
- Introspection and Tracing: LLMs에서의 introspection의 징후에 대한 연구 (2025년 10월) 및 대규모 언어 모델의 생각을 추적하기 위한 도구 연구 (2025년 3월).
- Tooling and Auditing: circuit tracing 도구의 오픈 소스 공개 (2025년 5월) 및 숨겨진 목표를 확인하기 위한 언어 모델 감사 (2025년 3월).
Sources
- OriginalInterpretability Research
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch