Gemma Scope 2 发布 – 用于解释 Gemma 3 语言模型的开源工具

TL;DR

Gemma Scope 2 是一套针对整个 Gemma 3 系列(270 M–27 B 参数)的开源可解释性工具,使研究人员能够追踪内部计算并调试安全关键行为,如越狱、幻觉和阿谀奉承。


Gemma Scope 2 是什么

Gemma Scope 2 是一套全面、公开发布的工具包,让 AI 安全研究者检查 Gemma 3 语言模型的内部工作原理。它在原始 Gemma Scope 基础上增加了全尺度覆盖、精细的分析组件以及针对聊天微调变体的专用工具。

  • Scope – 支持所有 Gemma 3 模型尺寸,范围从 270 M 到 27 B 参数。
  • 开源 – 所有代码、数据和预训练组件均在开源许可证下发布,成为迄今为止 AI 实验室规模最大的可解释性发布。
  • 数据量 – 此次发布需要存储约 110 PB 的中间数据,并为辅助模型训练超过 1 万亿 参数。

核心技术进展

稀疏自编码器和转码器在每一层

Gemma Scope 2 为 Gemma 3 系列的 每个 transformer 层 训练稀疏自编码器(SAE)和转码器。这些组件充当显微镜,将高维激活模式映射为人类可读的概念。

新的解码器架构

  • 跳跃转码器 – 允许将层的激活直接映射到下游层,简化多步骤计算的重建。
  • 跨层转码器 – 能够归因跨多个层的行为,使得跟踪分布在网络中的算法更为容易。

Matryoshka 训练技术

Gemma Scope 2 采用 Matryoshka 训练技术(参见 arXiv:2503.17547)来提升 SAE 中概念的发现。该方法通过迭代细化编码器,降低冗余并提升提取特征的语义纯度。

针对聊天的行为工具

专用分析流水线针对经过聊天微调的 Gemma 3 模型。研究人员现在可以隔离并可视化负责以下行为的内部路径:

  • 越狱尝试和拒绝逻辑
  • 思维链推理的忠实度
  • 对用户提示的阿谀奉承式对齐

示例可视化

此次发布包含诸如“在线诈骗和欺诈邮件”特性的可视化,其中高亮的文本片段根据激活强度着色,展示模型如何检测与诈骗相关的概念。

特性可视化

为什么对 AI 安全重要

  • 调试新出现的行为 – 通过揭示内部算法步骤,研究人员可以精准定位模型为何生成有害输出,从而促进有针对性的缓解措施。
  • 审计大型模型 – 完整覆盖意味着安全分析不再局限于小型原型;仅在 27 B 参数模型中出现的行为现在也可以被检查。
  • 加速安全干预 – 开源工具降低了社区开发越狱检测器、幻觉抑制器和对齐检查的门槛,促进协作进展。

为研究人员提供的资源

  • 下载 – 完整包托管在 Hugging Face 上:https://huggingface.co/google/gemma-scope-2
  • 技术报告 – 详细的方法论和评估记录在 Gemma Scope 2 论文中(原帖中的 PDF 链接)。
  • 交互式演示 – 在线 Neuronpedia 演示让用户无需安装工具包即可探索激活。
  • Colab 教程 – 一个即开即用的 notebook 引导用户完成基础分析和可视化。

未来方向

DeepMind 期望社区使用 Gemma Scope 2 来:

  1. 识别并缓解即将发布的 LLM 中的越狱向量
  2. 通过将内部概念与错误输出关联,研究幻觉机制
  3. 探索模型声明推理与潜在计算之间的对齐差距
  4. 基于可解释性得到的实证洞见,为更安全的训练方案设计提供参考

通过提供前所未有的对现代语言模型“脑部”的访问,Gemma Scope 2 旨在使安全关键研究更加可重复、透明且具有影响力。


相关链接

Sources