Gemma Scope 2 發佈 – 用於解讀 Gemma 3 語言模型的開源工具

TL;DR

Gemma Scope 2 是一套針對整個 Gemma 3 系列(270 M–27 B 參數)的開源可解釋性工具,讓研究人員能追蹤內部計算並除錯安全關鍵行為,例如越獄、幻覺與諂媚。


Gemma Scope 2 是什麼

Gemma Scope 2 是一套完整、公開發佈的工具組,讓 AI 安全研究人員檢視 Gemma 3 語言模型的內部運作。它在原始 Gemma Scope 基礎上加入了全尺度覆蓋、精緻的分析元件,以及針對聊天微調變體的專門工具。

  • Scope – 支援所有 Gemma 3 模型尺寸,從 270 M 到 27 B 參數。
  • Open‑source – 所有程式碼、資料與預訓練元件皆以開放授權釋出,成為迄今為止 AI 研究所最大規模的可解釋性釋出。
  • Data volume – 此次釋出需要儲存約 110 PB 的中間資料,並為輔助模型訓練超過 1 trillion 個參數。

核心技術進展

每層稀疏自編碼器與轉碼器

Gemma Scope 2 為 Gemma 3 系列的 每個 transformer 層 訓練稀疏自編碼器(SAE)與轉碼器。這些元件如同顯微鏡,將高維度的激活模式映射為人類可讀的概念。

新的解碼器架構

  • Skip‑transcoders – 允許直接將某層的激活映射至下游層,簡化多步計算的重建。
  • Cross‑layer transcoders – 使能夠歸因於跨多層的行為,讓追蹤分散於網路各層的演算法變得更容易。

Matryoshka 訓練技術

Gemma Scope 2 採用 Matryoshka 訓練技術(見 arXiv:2503.17547)以提升 SAEs 中概念的發掘。此方法會迭代精煉編碼器,減少冗餘並提升抽取特徵的語意純度。

針對聊天的行為工具

專屬的分析管線針對 Gemma 3 的聊天微調模型。研究人員現在可以分離並視覺化負責以下行為的內部路徑:

  • 越獄嘗試與拒絕邏輯
  • 思考鏈推理的忠實度
  • 對使用者提示的諂媚對齊

示例視覺化

此釋出包含如「線上詐騙與欺詐郵件」功能的視覺化,突出顯示的文字片段依激活強度著色,示範模型如何偵測詐騙相關概念。

Feature visualisation

為何對 AI 安全重要

  • Debugging emergent behaviours – 透過揭露內部演算法步驟,研究人員能精確定位模型產生有害輸出的原因,促進針對性的緩解。
  • Auditing large models – 全尺度覆蓋意味著安全分析不再僅限於小型原型;僅在 27 B 參數模型中出現的行為現在也能被檢視。
  • Accelerating safety interventions – 開源工具降低了社群開發越獄偵測器、幻覺減少器與對齊檢查的門檻,促進協作式的進步。

研究人員資源

  • Download – 完整套件託管於 Hugging Face: https://huggingface.co/google/gemma-scope-2
  • Technical report – 詳盡的方法論與評估已記錄於 Gemma Scope 2 論文(PDF 連結見原始貼文)。
  • Interactive demo – 線上 Neuronpedia 示範讓使用者在不安裝工具組的情況下探索激活。
  • Colab tutorial – 可直接執行的 notebook 引導使用者完成基本分析與視覺化。

未來方向

DeepMind 預期社群將使用 Gemma Scope 2 來:

  1. 辨識並緩解越獄向量 在即將發布的 LLM 中。
  2. 研究幻覺機制,透過將內部概念與錯誤輸出相關聯。
  3. 探索對齊差距,即模型聲稱的推理與其潛在計算之間的落差。
  4. 根據可解釋性實證洞見,為更安全的訓練方案設計提供資訊

透過前所未有的方式存取現代語言模型的「大腦」,Gemma Scope 2 旨在使安全關鍵的研究更具可重現性、透明度與影響力。


相關連結

Sources