anthropics/jacobian-lens
Companion code for the global workspace interpretability paper
해결하는 문제
언어 모델이 내부적으로 "생각"하고 있는 내용을 이해할 수 있는 방법을 제공합니다. 임의의 레이어에서의 숨겨진 활성화를 실제 어휘 토큰으로 변환함으로써, 입력 텍스트에 나타나지 않은 단어나 개념이 특정 위치와 레이어에서 모델이 처리하고 있는지 확인할 수 있습니다.
작동 방식
이 도구는 '야코비안 렌즈'라고 불리는 선형 이동 메커니즘을 사용합니다. 텍스트 코퍼스 전체에 걸쳐 입력-출력 야코비안의 평균을 계산하여 중간 레이어의 리지드 스트림 벡터를 최종 레이어 기저로 매핑합니다. 이 벡터는 운반된 후 모델의 자체 언임베딩 레이어를 사용하여 디코딩되어 가능성이 높은 토큰의 순위 목록을 생성합니다.
대상 사용자
오픈웨이트 디코더 트랜스포머의 내부 표현을 기계적 해석학적으로 이해하고자 하는 AI 연구자 및 개발자에게 적합합니다.
주요 기능
- 내부 리드아웃: 내부 활성화를 인간이 읽을 수 있는 토큰으로 변환합니다.
- 레이어별 분석: 임의의 레이어와 위치에 렌즈를 적용하여 표현의 진화를 추적할 수 있습니다.
- 인터랙티브 시각화: 순위 추적 차트와 히트맵을 포함한 레이어별 위치 시각화 도구를 제공합니다.
- 사용자 정의 피팅: 제공된 프롬프트 세트를 사용하여 자신의 모델에 새로운 렌즈를 피팅할 수 있습니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch
- Dispatch