OpenAI 희소 회로를 통한 신경망 이해

OpenAI는 높은 희소성을 가진 언어 모델을 훈련시켜 대부분의 가중치를 0으로 강제함으로써 기계적 해석 가능성을 향상시키는 연구 접근법을 도입했습니다. 이 방법은 이해하기 쉽고 특정 알고리즘 작업을 수행하기에 충분한 작은 분리된 "회로"를 포함하는 모델을 생성하며, 더 큰 AI 시스템의 내부 계산을 이해하기 위한 확장 가능한 경로를 제시합니다.

기계적 해석 가능성 vs. 사고의 사슬

OpenAI는 모델 출력을 이해하는 두 가지 주요 방법을 구분합니다:

  • 사고의 사슬 해석 가능성: 이는 추론 모델이 프로세스 중에 생성하는 설명을 활용하여 행동을 모니터링하는 것입니다. 속임수와 같은 문제를 감지하는 데 유용하지만, OpenAI는 이것이 시간이 지남에 따라 무너질 수 있는 "취약한 전략"이라고 지적합니다.
  • 기계적 해석 가능성: 이 접근법은 가장 세부적인 수준에서 모델의 계산을 완전히 역공학적으로 분석하려고 합니다. 구현이 더 어렵지만, 더 적은 가정을 하며 모델 행동의 설명에 대한 신뢰도를 높입니다.

해석 가능성은 더 나은 감독을 가능하게 하고 전략적으로 잘못된 또는 안전하지 않은 행동의 조기 경고 신호를 제공하는 중요한 안전 구성 요소로 간주되며, 적대적 훈련 및 레드 팀링을 보완합니다.

분리를 위한 희소 모델 학습

전통적인 신경망은 밀집되어 있고 얽혀 있으며, 각 뉴런은 수천 개의 다른 뉴런과 연결되고 종종 여러 가지 distinct 기능을 수행합니다.これを解決するために、OpenAIは特定の制約条件(モデルの重みの大部分をゼロに強制する)を付けて言語モデル(GPT-2アーキテクチャに似ている)を訓練しました。

各ニューロンが持つ接続数を数十に制限することで、研究者はモデルの内部計算を分離しようとしています。この密結合から疎結合へのシフトは、ニューロンと全体のネットワークアーキテクチャを人間が解読しやすくすることを意図しています。

회로를 통한 해석 가능성 평가

이 접근법의 성공을 측정하기 위해 OpenAI는 특정 행동을 담당하는 모델의 가장 작은 부분인 "회로"를 분리했습니다. 연구에서는 더 크고 희소한 모델을 훈련시킴으로써 간단하고 해석 가능한 회로를 유지하면서 점점 더 capaces한 모델을 만들 수 있음을 발견했습니다.

사례 연구: Python 따옴표 완성

문자열을 올바른Matching 따옴표(싱글 vs. 더블)로 완성해야 하는 작업에서, 희소 모델은 특정하고 분리된 알고리즘을 구현했습니다:

  1. 인코딩: 싱글 및 더블 따옴표는 별도의 잔차 채널에 인코딩됩니다.
  2. 분류: MLP 레이어는これを 하나의 채널(어떤 따옴표든 감지)과 다른 채널(따옴표 유형을 분류)으로 변환합니다.
  3. 주의: 주의 작업은 intervening 토큰을 무시하여 이전 따옴표를 찾고 그 유형을 최종 토큰으로 복사합니다.
  4. 예측: 모델은 일치하는 닫는 따옴표를 예측합니다.

이 회로는 오직 다섯 개의 잔차 채널, 레이어 0의 두 개의 MLP 뉴런, 그리고 레이어 10의 하나의 어텐션 쿼리-키 채널과 하나의 값 채널로 구성됩니다. 이러한 연결은 충분합니다(나머지 모델을 제거해도 작업을 수행할 수 있음)하고 필요합니다(이러한 엣지를 삭제하면 모델이 실패함).

복잡한 행동과 변수 바인딩

변수 바인딩과 같은 더 복잡한 작업의 경우, 회로를 완전히 설명하기가 더 어렵습니다. 그러나 연구자들은 여전히 모델의 행동을 예측하는 부분적인 설명을 달성할 수 있었습니다. 예를 들어, 변수 바인딩에서 하나의 주의 작업은 정의 중에 변수 이름을 set() 토큰에 복사하고, 이후 작업은 set() 토큰에서 유형을 변수의 이후 사용으로 복사합니다.

미래 방향과 확장성

이러한 희소 모델은 frontier 모델보다 현저히 작지만, OpenAI는 이러한 결과를 확장하기 위한 두 가지 주요 경로를 식별합니다:

  1. 추출: 기존의 밀집 모델에서 희소 회로를 추출하는 것이며, 이는 배포에 더 효율적입니다.
  2. 훈련 효율성: 해석 가능성을 위해 특별히 모델을 훈련시키는 더 효율적인 기술을 개발하여 production-ready 상태로 만드는 것입니다.

OpenAI는 이러한 결과가 간단한 행동에 대해 유망하지만, 가장 capaz한 시스템으로 확장될 것이라는 보장은 없다고 언급하지만, 목표는 미래의 AI 시스템을 분석, 디버그, 평가하기 쉽게 만드는 도구를 구축하는 것입니다.

Sources