Gemma Scope 2 출시 – Gemma 3 언어 모델 해석을 위한 오픈 도구

TL;DR

Gemma Scope 2는 전체 Gemma 3 제품군(270M~27B 매개변수)을 위한 해석 가능성 도구 오픈소스 스위트로, 연구자들이 내부 계산을 추적하고 안전‑중요한 행동(예: 탈옥, 환각, 아첨)을 디버그할 수 있게 합니다.


Gemma Scope 2란 무엇인가

Gemma Scope 2는 포괄적으로 공개된 툴킷으로, AI 안전 연구자들이 Gemma 3 언어 모델의 내부 작동을 검사할 수 있게 합니다. 이는 전체 규모 커버리지, 정교한 분석 구성 요소, 챗 튜닝 변형을 위한 특수 도구를 추가하여 원래의 Gemma Scope를 기반으로 구축되었습니다.

  • Scope – 270M부터 27B까지의 모든 Gemma 3 모델 크기를 지원합니다.
  • Open‑source – 모든 코드, 데이터, 사전 학습된 구성 요소가 오픈 라이선스로 출시되어, 현재까지 AI 연구소에서 출시된 가장 큰 해석 가능성 릴리스입니다.
  • Data volume – 이 릴리스는 중간 데이터 약 110PB를 저장하고 보조 모델을 위해 1조 이상의 매개변수를 훈련하는 것이 필요했습니다.

핵심 기술적 발전

모든 레이어에서의 스파스 자동인코더와 트랜스코더

Gemma Scope 2는 Gemma 3 제품군의 각 트랜스포머 레이어에 대해 스파스 자동인코더(SAE)와 트랜스코더를 훈련합니다. 이러한 구성 요소는 현미경처럼 작용하여 고차원 활성화 패턴을 인간이 읽을 수 있는 개념으로 매핑합니다.

새로운 디코더 아키텍처

  • Skip‑transcoders – 레이어의 활성화를 하류 레이어에 직접 매핑하여 다단계 계산의 재구성을 간소화합니다.
  • Cross‑layer transcoders – 여러 레이어에 걸쳐 있는 행동에 대한 귀인을 가능하게 하여 네트워크 전반에 분산된 알고리즘을 추적하기 쉽게 합니다.

마트료시카 훈련 기법

Gemma Scope 2는 SAE에서의 개념 발견을 개선하기 위해 마트료시카 훈련 기법(arXiv:2503.17547 참조)을 채택합니다. 이 방법은 인코더를 반복적으로 정제하여 중복을 줄이고 추출된 특징의 의미적 순도를 높입니다.

채팅 특화 행동 도구

채팅에 맞게 미세 조정된 Gemma 3 모델을 대상으로 하는 전용 분석 파이프라인이 있습니다. 연구자들은 이제 다음과 담당하는 내부 경로를 분리하고 시각화할 수 있습니다:

  • 탈옥 시도 및 거부 로직
  • 사고사슬 추론 충실도
  • 사용자 프롬프트에 대한 아첨적 정렬

예시 시각화

이 릴리스에는 “온라인 사기 및 사기성 이메일” 기능과 같은 시각화가 포함되어 있으며, 여기서 강조된 텍스트 조각은 활성화 강도에 따라 색칠되어 모델이 사기 관련 개념을 어떻게 감지하는지를 보여줍니다.

기능 시각화

AI 안전 측면에서 왜 중요한가

  • 비상 행동 디버깅 – 내부 알고리즘 단계를 노출함으로써 연구자들은 모델이 유해한 출력을 생성하는 이유를 정확히 파악하여 대상별 완화를 용이하게 할 수 있습니다.
  • 대규모 모델 감사 – 전체 규모 커버리지 덕분에 안전 분석은 더 이상 소규모 프로토타입에 국한되지 않으며, 27B 매개변수 모델에서만 나타나는 행동도 이제 검사할 수 있습니다.
  • 안전 개입 가속화 – 오픈 도구는 커뮤니티가 탈옥 탐지기, 환각 감소기, 정렬 검사를 개발하는 장벽을 낮추어 협력적 진전을 촉진합니다.

연구자를 위한 리소스

  • 다운로드 – 전체 패키지는 Hugging Face에서 호스팅됩니다: https://huggingface.co/google/gemma-scope-2
  • 기술 보고서 – 상세한 방법론과 평가는 Gemma Scope 2 논문(원본 게시물의 PDF 링크)에 문서화되어 있습니다.
  • 대화형 데모 – 온라인 Neuronpedia 데모를 통해 툴킷을 설치하지 않고도 활성화를 탐색할 수 있습니다.
  • Colab 튜토리얼 – 바로 실행 가능한 노트북이 기본 분석 및 시각화를 안내합니다.

미래 방향

DeepMind는 커뮤니티가 Gemma Scope 2를 다음과 같이 사용하기를 기대합니다:

  1. ** impending LLM 릴리스에서의 탈옥 벡터 식별 및 완화**
  2. 내부 개념과 오류 출력을 상관시켜 환각 메커니즘 연구
  3. 모델의 명시적 추론과 잠재적 계산 사이의 정렬 격차 탐색
  4. 해석 가능성의 경험적 통찰을 기반으로 더 안전한 훈련 체제 설계에 정보 제공

By providing unprecedented access to the “brain” of modern language models, Gemma Scope 2 aims to make safety‑critical research more reproducible, transparent, and impactful.


관련 링크

Sources