Gemma Scope 2 출시 – Gemma 3 언어 모델 해석을 위한 오픈 도구
TL;DR
Gemma Scope 2는 전체 Gemma 3 제품군(270M~27B 매개변수)을 위한 해석 가능성 도구 오픈소스 스위트로, 연구자들이 내부 계산을 추적하고 안전‑중요한 행동(예: 탈옥, 환각, 아첨)을 디버그할 수 있게 합니다.
Gemma Scope 2란 무엇인가
Gemma Scope 2는 포괄적으로 공개된 툴킷으로, AI 안전 연구자들이 Gemma 3 언어 모델의 내부 작동을 검사할 수 있게 합니다. 이는 전체 규모 커버리지, 정교한 분석 구성 요소, 챗 튜닝 변형을 위한 특수 도구를 추가하여 원래의 Gemma Scope를 기반으로 구축되었습니다.
- Scope – 270M부터 27B까지의 모든 Gemma 3 모델 크기를 지원합니다.
- Open‑source – 모든 코드, 데이터, 사전 학습된 구성 요소가 오픈 라이선스로 출시되어, 현재까지 AI 연구소에서 출시된 가장 큰 해석 가능성 릴리스입니다.
- Data volume – 이 릴리스는 중간 데이터 약 110PB를 저장하고 보조 모델을 위해 1조 이상의 매개변수를 훈련하는 것이 필요했습니다.
핵심 기술적 발전
모든 레이어에서의 스파스 자동인코더와 트랜스코더
Gemma Scope 2는 Gemma 3 제품군의 각 트랜스포머 레이어에 대해 스파스 자동인코더(SAE)와 트랜스코더를 훈련합니다. 이러한 구성 요소는 현미경처럼 작용하여 고차원 활성화 패턴을 인간이 읽을 수 있는 개념으로 매핑합니다.
새로운 디코더 아키텍처
- Skip‑transcoders – 레이어의 활성화를 하류 레이어에 직접 매핑하여 다단계 계산의 재구성을 간소화합니다.
- Cross‑layer transcoders – 여러 레이어에 걸쳐 있는 행동에 대한 귀인을 가능하게 하여 네트워크 전반에 분산된 알고리즘을 추적하기 쉽게 합니다.
마트료시카 훈련 기법
Gemma Scope 2는 SAE에서의 개념 발견을 개선하기 위해 마트료시카 훈련 기법(arXiv:2503.17547 참조)을 채택합니다. 이 방법은 인코더를 반복적으로 정제하여 중복을 줄이고 추출된 특징의 의미적 순도를 높입니다.
채팅 특화 행동 도구
채팅에 맞게 미세 조정된 Gemma 3 모델을 대상으로 하는 전용 분석 파이프라인이 있습니다. 연구자들은 이제 다음과 담당하는 내부 경로를 분리하고 시각화할 수 있습니다:
- 탈옥 시도 및 거부 로직
- 사고사슬 추론 충실도
- 사용자 프롬프트에 대한 아첨적 정렬
예시 시각화
이 릴리스에는 “온라인 사기 및 사기성 이메일” 기능과 같은 시각화가 포함되어 있으며, 여기서 강조된 텍스트 조각은 활성화 강도에 따라 색칠되어 모델이 사기 관련 개념을 어떻게 감지하는지를 보여줍니다.
AI 안전 측면에서 왜 중요한가
- 비상 행동 디버깅 – 내부 알고리즘 단계를 노출함으로써 연구자들은 모델이 유해한 출력을 생성하는 이유를 정확히 파악하여 대상별 완화를 용이하게 할 수 있습니다.
- 대규모 모델 감사 – 전체 규모 커버리지 덕분에 안전 분석은 더 이상 소규모 프로토타입에 국한되지 않으며, 27B 매개변수 모델에서만 나타나는 행동도 이제 검사할 수 있습니다.
- 안전 개입 가속화 – 오픈 도구는 커뮤니티가 탈옥 탐지기, 환각 감소기, 정렬 검사를 개발하는 장벽을 낮추어 협력적 진전을 촉진합니다.
연구자를 위한 리소스
- 다운로드 – 전체 패키지는 Hugging Face에서 호스팅됩니다: https://huggingface.co/google/gemma-scope-2
- 기술 보고서 – 상세한 방법론과 평가는 Gemma Scope 2 논문(원본 게시물의 PDF 링크)에 문서화되어 있습니다.
- 대화형 데모 – 온라인 Neuronpedia 데모를 통해 툴킷을 설치하지 않고도 활성화를 탐색할 수 있습니다.
- Colab 튜토리얼 – 바로 실행 가능한 노트북이 기본 분석 및 시각화를 안내합니다.
미래 방향
DeepMind는 커뮤니티가 Gemma Scope 2를 다음과 같이 사용하기를 기대합니다:
- ** impending LLM 릴리스에서의 탈옥 벡터 식별 및 완화**
- 내부 개념과 오류 출력을 상관시켜 환각 메커니즘 연구
- 모델의 명시적 추론과 잠재적 계산 사이의 정렬 격차 탐색
- 해석 가능성의 경험적 통찰을 기반으로 더 안전한 훈련 체제 설계에 정보 제공
By providing unprecedented access to the “brain” of modern language models, Gemma Scope 2 aims to make safety‑critical research more reproducible, transparent, and impactful.
관련 링크
- Gemma 3 모델 가족 – https://deepmind.google/models/gemma/gemma-3/
- 원래 Gemma Scope – https://deepmind.google/blog/gemma-scope-helping-the-safety-community-shed-light-on-the-inner-workings-of-language-models/
- Neuronpedia 데모 – https://neuronpedia.org/gemma-scope-2
- 기술 논문 (PDF) – https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/gemma-scope-2-helping-the-ai-safety-community-deepen-understanding-of-complex-language-model-behavior/Gemma_Scope_2_Technical_Paper.pdf