GPT-4에서 개념 추출하기
OpenAI는 "특징"이라고 불리는 1,600만 개의 잠재적으로 인간이 해석할 수 있는 패턴으로 GPT-4의 내부 표현을 분해하는 새로운 확장 가능한 방법을 소개했습니다. 이 연구는 대형 언어 모델(LLM)의 내부 작동 방식을 이해하고 해석 가능성을 통해 AI 안전성을 향상시키는 중요한 단계입니다.
신경망 해석 가능성의 도전
신경망은 직접 설계되지 않고, 이를 훈련시키는 알고리즘이 설계됩니다. 이 때문에 결과 네트워크를 식별 가능한 부분으로 쉽게 분해할 수 없는 "블랙 박스" 문제가 발생하며, AI 안전성에 대한 추론이 자동차 안전과 같은 전통적인 엔지니어링 안전에 대한 추론과 근본적으로 다르게 됩니다.
이 모델들을 해석하려면 신경 계산의 기본 빌딩 블록을 찾아야 합니다. 어려움은 두 가지 주요 영역에 있습니다:
- 조밀한 활성화: 언어 모델의 신경 활성은 대부분의 입력에 대해 발생하며 동시에 많은 개념을 나타냅니다.
- 현실 세계 개념의 희소성: 특정 상황에서는 전체 가능한 개념 중 아주 작은 부분만이 관련됩니다.
희소 오토인코더는 특정 출력에 중요한 소수의 특징을 식별함으로써 조밀한 신경 활동을 인간이 더 쉽게 이해할 수 있는 희소 활성화 패턴과 정렬하는 데 사용됩니다.
대규모 오토인코더 훈련 및 결과
OpenAI는 희소 오토인코더를 최첨단 AI 모델에서 수천만 개의 특징으로 확장할 수 있는 새로운 방법론을 개발했습니다. 이 접근법은 이전 기술보다 더 나은 수익을 제공하면서 부드럽고 예측 가능한 스케일링을 보여줍니다.
이 레시피를 사용해 OpenAI는 GPT-2 small과 GPT-4 활성에 대해 오토인코더를 훈련했습니다. GPT-4 오토인코더는 1,600만 개의 특징을 식별했습니다. 해석 가능성을 검증하기 위해 OpenAI는 이러한 특징이 활성화되는 문서를 분석하여 시각화했습니다. 식별된 해석 가능한 특징의 예는 다음과 같습니다:
- 인간의 불완전성: 인간이나 사물이 결함이 있다는 문구.
- 가격 상승: 경제적 변동과 관련된 패턴.
- X와 Y: 수학적 또는 좌표 기반 패턴.
- 훈련 로그: 소프트웨어 훈련에서 나온 기술 로그.
- 수사적 질문: 효과를 위해 사용되는 언어 구조.
- 대수적 환: 특정 수학 개념.
- 도파민이란/무엇인가: 생물학적 또는 화학적 개념.
현재 제한 사항
이 연구가 이정표이지만, OpenAI는 몇 가지 중요한 제한점을 지적합니다:
- 해석 가능성 격차: 발견된 많은 특징이 여전히 해석하기 어렵고, 명확한 패턴이 없거나 인코딩된 개념과 무관한 거짓 활성화를 보입니다.
- 불완전한 커버리지: 희소 오토인코더는 모델 행동을 모두 포착하지 못합니다. GPT-4 활성을 오토인코더에 통과시키면 약 10배 적은 연산량으로 훈련된 모델과 동등한 성능을 보입니다.
- 계산 규모: 최첨단 LLM의 모든 개념을 완전히 매핑하려면 수십억~수조 개의 특징으로 확장해야 할 수 있으며, 이는 여전히 도전 과제입니다.
- 기능적 이해: 모델의 한 지점에서 특징을 식별하는 것은 한 단계에 불과합니다. 모델이 이러한 특징을 어떻게 계산하고 하위 단계에서 어떻게 활용하는지 이해하려면 추가 연구가 필요합니다.
향후 방향 및 오픈 소스 기여
OpenAI는 이러한 특징을 활용해 최첨단 모델의 언어 모델 행동을 실용적으로 모니터링하고 조정하는 것을 목표로 합니다. 궁극적인 목표는 해석 가능성을 통해 모델 행동에 대한 강력한 보증을 제공하여 AI 견고성 및 안전성에 대한 신뢰를 높이는 것입니다.
연구 커뮤니티를 지원하기 위해 OpenAI는 다음 리소스를 공개했습니다:
- 연구 논문: 실험 및 방법에 대한 상세 보고서.
- 코드: 오토인코더 사용을 위한 코드.
- 전체 오토인코더 모음: GPT-2 small용 완전한 오토인코더 세트.
- 특징 시각화 도구: GPT-2와 GPT-4 특징을 탐색하는 도구.
Sources
- OriginalExtracting Concepts from GPT-4