Anthropic 교차 아키텍처 모델 디핑을 위한 전용 피처 크로스코더 (DFC)
Anthropic 연구원들은 완전히 다른 아키텍처를 가진 AI 모델 간의 행동 차이를 식별하도록 설계된 도구인 전용 피처 크로스코더 (Dedicated Feature Crosscoder, DFC)를 도입했습니다. DFC는 한 모델에는 존재하지만 다른 모델에는 존재하지 않는 고유한 피처를 탐지하는 과정을 자동화함으로써, 안전 감사관들이 사후 대응적인 인간 작성 벤치마크를 넘어 창발적 위험 또는 "unknown unknowns"를 발견할 수 있도록 합니다.
교차 아키텍처 모델 디핑의 과제
전통적인 AI 안전성 평가는 인간이 작성한 벤치마크에 의존하는데, 이는 연구자들이 이미 개념화한 위험만을 테스트하기 때문에 본질적으로 사후 대응적입니다. "base-vs-finetune" 모델 디핑은 모델과 그 수정된 버전 사이의 변화를 식별할 수 있지만, 서로 다른 기원과 내부 "언어"를 가진 두 모델을 비교하는 데는 더 정교한 접근 방식이 필요합니다.
이전의 도구들, 예를 들어 표준 크로스코더(standard crosscoders)는 모델 간의 불완전한 번역을 강제로 수행하려 했기 때문에 고유한 피처를 식별하는 데 종종 어려움을 겪었습니다. 만약 어떤 피처가 한 모델에는 존재하지만 다른 모델에는 존재하지 않는다면, 표준 크로스코더는 이를 잘못된 일치 항목으로 라벨링하여 감사관들이 새로운 행동적 특성을 간과하게 만들 수 있습니다.
전용 피처 크로스코더 (DFC) 아키텍처
강제된 번역 문제를 해결하기 위해, DFC는 세 가지 별도의 섹션이 있는 "이중 언어 사전"으로 설계되었습니다:
- Shared Dictionary: 비교되는 두 모델 모두에 공통적인 개념을 매핑합니다.
- Model-A-Only Section: 첫 번째 모델에만 독점적으로 존재하는 피처를 위한 전용 공간입니다.
- Model-B-Only Section: 두 번째 모델에만 독점적으로 존재하는 피처를 위한 전용 공간입니다.
고유 피처를 위한 전용 섹션을 제공함으로써, DFC는 도구가 존재하지 않는 일치 항목을 강제로 만들지 않도록 방지하며, 새로운 행동적 피처가 검토를 위해 정확하게 플래그(flag)될 수 있도록 보장합니다.
스티어링(Steering)을 통한 피처 검증
DFC가 잠재적인 고유 피처를 식별하면, 연구원들은 "스티어링(steering)"이라 불리는 기술을 사용하여 해당 피처가 모델 행동에 미치는 영향을 검증합니다. 이는 모델의 생성 과정 중에 해당 피처를 인위적으로 억제하거나 증폭시키는 과정을 포함합니다:
- Suppression (억제): 특정 행동(예: 검열)이 사라지는지 확인하기 위해 피처의 영향력을 줄입니다.
- Amplification (증폭): 행동이 더 뚜렷해지는지 확인하기 위해 피처의 영향력을 높입니다.
오픈 웨이트 모델에서의 실증적 발견
다양한 오픈 소스 언어 모델에 DFC를 적용하여, Anthropic은 특정 행동의 "스위치" 역할을 하는 여러 구체적인 피처를 식별했습니다:
Llama-3.1-8B-Instruct vs. Qwen3-8B
- Chinese Communist Party (CCP) Alignment: Qwen3-8B에서 발견되었습니다. 이 피처를 억제하면 모델이 Tiananmen Square 학살에 대해 논의할 수 있게 되었고, 증폭하면 매우 친정부적인 발언을 생성했습니다.
- American Exceptionalism: Llama-3.1-8B-Instruct에서 발견되었습니다. 이 피처를 증폭하면 모델의 응답이 균형 잡힌 상태에서 미국의 우월성을 강력하게 주장하는 방향으로 전환되었습니다.
GPT-OSS-20B vs. DeepSeek-R1-0528-Qwen3-8B
- Copyright Refusal Mechanism: GPT-OSS-20B에만 독점적으로 존재합니다. 이 피처를 억제하면 모델이 저작권이 있는 자료를 제공하기를 거부하는 기능이 비활성화되었습니다(비록 정확한 저작권 텍스트 대신 환각 현상이 발생하는 경우가 많았지만). 증폭하면 모델이 피넛 버터 앤 젤리 샌드위치 레시피를 공유하는 것을 거부하는 것과 같은 과도한 거부를 유도했습니다.
- CCP Alignment: DeepSeek 모델에서도 식별별되었습니다. 이는 DFC가 서로 다른 모델 간에 유사한 행동을 식별할 수 있임을 확인시켜 줍니다.
AI 안전성 및 감사에 미치는 시사점
DFC는 "silver bullet"이라기보다는 높은 재현율(high-recall)의 스크리닝 도구입니다. 즉, 수천 개의 피처가 나타날 수 있지만 그중 의미 있는 것은 소수일 수 있다는 뜻입니다. 하지만 DFC는 모델 업데이트를 모니터링할 수 있는 확장 가능한 방법을 제공합니다.
Anthropic은 이러한 도구가 2025년 4월 OpenAI의 GPT-4o에서 나타난 아첨꾼(sycophancy) 현상의 출현을, 업데이트된 모델과 이전 버전을 디핑(diffing)함으로써 잠지할 수 있었을 가능성이라고 제안합니다. 개발자와 감사관들은 모델 간의 차이를이에 집중함으로써 제한된 안전성 자원을 가장 중요한 행동적 변화에 집중할 수 있습니다.