Gemma Scope 2 发布 – 用于解释 Gemma 3 语言模型的开源工具
TL;DR
Gemma Scope 2 是一套针对整个 Gemma 3 系列(270 M–27 B 参数)的开源可解释性工具,使研究人员能够追踪内部计算并调试安全关键行为,如越狱、幻觉和阿谀奉承。
Gemma Scope 2 是什么
Gemma Scope 2 是一套全面、公开发布的工具包,让 AI 安全研究者检查 Gemma 3 语言模型的内部工作原理。它在原始 Gemma Scope 基础上增加了全尺度覆盖、精细的分析组件以及针对聊天微调变体的专用工具。
- Scope – 支持所有 Gemma 3 模型尺寸,范围从 270 M 到 27 B 参数。
- 开源 – 所有代码、数据和预训练组件均在开源许可证下发布,成为迄今为止 AI 实验室规模最大的可解释性发布。
- 数据量 – 此次发布需要存储约 110 PB 的中间数据,并为辅助模型训练超过 1 万亿 参数。
核心技术进展
稀疏自编码器和转码器在每一层
Gemma Scope 2 为 Gemma 3 系列的 每个 transformer 层 训练稀疏自编码器(SAE)和转码器。这些组件充当显微镜,将高维激活模式映射为人类可读的概念。
新的解码器架构
- 跳跃转码器 – 允许将层的激活直接映射到下游层,简化多步骤计算的重建。
- 跨层转码器 – 能够归因跨多个层的行为,使得跟踪分布在网络中的算法更为容易。
Matryoshka 训练技术
Gemma Scope 2 采用 Matryoshka 训练技术(参见 arXiv:2503.17547)来提升 SAE 中概念的发现。该方法通过迭代细化编码器,降低冗余并提升提取特征的语义纯度。
针对聊天的行为工具
专用分析流水线针对经过聊天微调的 Gemma 3 模型。研究人员现在可以隔离并可视化负责以下行为的内部路径:
- 越狱尝试和拒绝逻辑
- 思维链推理的忠实度
- 对用户提示的阿谀奉承式对齐
示例可视化
此次发布包含诸如“在线诈骗和欺诈邮件”特性的可视化,其中高亮的文本片段根据激活强度着色,展示模型如何检测与诈骗相关的概念。
为什么对 AI 安全重要
- 调试新出现的行为 – 通过揭示内部算法步骤,研究人员可以精准定位模型为何生成有害输出,从而促进有针对性的缓解措施。
- 审计大型模型 – 完整覆盖意味着安全分析不再局限于小型原型;仅在 27 B 参数模型中出现的行为现在也可以被检查。
- 加速安全干预 – 开源工具降低了社区开发越狱检测器、幻觉抑制器和对齐检查的门槛,促进协作进展。
为研究人员提供的资源
- 下载 – 完整包托管在 Hugging Face 上:https://huggingface.co/google/gemma-scope-2
- 技术报告 – 详细的方法论和评估记录在 Gemma Scope 2 论文中(原帖中的 PDF 链接)。
- 交互式演示 – 在线 Neuronpedia 演示让用户无需安装工具包即可探索激活。
- Colab 教程 – 一个即开即用的 notebook 引导用户完成基础分析和可视化。
未来方向
DeepMind 期望社区使用 Gemma Scope 2 来:
- 识别并缓解即将发布的 LLM 中的越狱向量。
- 通过将内部概念与错误输出关联,研究幻觉机制。
- 探索模型声明推理与潜在计算之间的对齐差距。
- 基于可解释性得到的实证洞见,为更安全的训练方案设计提供参考。
通过提供前所未有的对现代语言模型“脑部”的访问,Gemma Scope 2 旨在使安全关键研究更加可重复、透明且具有影响力。
相关链接
- Gemma 3 模型系列 – https://deepmind.google/models/gemma/gemma-3/
- 原始 Gemma Scope – https://deepmind.google/blog/gemma-scope-helping-the-safety-community-shed-light-on-the-inner-workings-of-language-models/
- Neuronpedia 演示 – https://neuronpedia.org/gemma-scope-2
- 技术论文(PDF) – https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/gemma-scope-2-helping-the-ai-safety-community-deepen-understanding-of-complex-language-model-behavior/Gemma_Scope_2_Technical_Paper.pdf