Gemma Scope 2 發佈 – 用於解讀 Gemma 3 語言模型的開源工具
TL;DR
Gemma Scope 2 是一套針對整個 Gemma 3 系列(270 M–27 B 參數)的開源可解釋性工具,讓研究人員能追蹤內部計算並除錯安全關鍵行為,例如越獄、幻覺與諂媚。
Gemma Scope 2 是什麼
Gemma Scope 2 是一套完整、公開發佈的工具組,讓 AI 安全研究人員檢視 Gemma 3 語言模型的內部運作。它在原始 Gemma Scope 基礎上加入了全尺度覆蓋、精緻的分析元件,以及針對聊天微調變體的專門工具。
- Scope – 支援所有 Gemma 3 模型尺寸,從 270 M 到 27 B 參數。
- Open‑source – 所有程式碼、資料與預訓練元件皆以開放授權釋出,成為迄今為止 AI 研究所最大規模的可解釋性釋出。
- Data volume – 此次釋出需要儲存約 110 PB 的中間資料,並為輔助模型訓練超過 1 trillion 個參數。
核心技術進展
每層稀疏自編碼器與轉碼器
Gemma Scope 2 為 Gemma 3 系列的 每個 transformer 層 訓練稀疏自編碼器(SAE)與轉碼器。這些元件如同顯微鏡,將高維度的激活模式映射為人類可讀的概念。
新的解碼器架構
- Skip‑transcoders – 允許直接將某層的激活映射至下游層,簡化多步計算的重建。
- Cross‑layer transcoders – 使能夠歸因於跨多層的行為,讓追蹤分散於網路各層的演算法變得更容易。
Matryoshka 訓練技術
Gemma Scope 2 採用 Matryoshka 訓練技術(見 arXiv:2503.17547)以提升 SAEs 中概念的發掘。此方法會迭代精煉編碼器,減少冗餘並提升抽取特徵的語意純度。
針對聊天的行為工具
專屬的分析管線針對 Gemma 3 的聊天微調模型。研究人員現在可以分離並視覺化負責以下行為的內部路徑:
- 越獄嘗試與拒絕邏輯
- 思考鏈推理的忠實度
- 對使用者提示的諂媚對齊
示例視覺化
此釋出包含如「線上詐騙與欺詐郵件」功能的視覺化,突出顯示的文字片段依激活強度著色,示範模型如何偵測詐騙相關概念。
為何對 AI 安全重要
- Debugging emergent behaviours – 透過揭露內部演算法步驟,研究人員能精確定位模型產生有害輸出的原因,促進針對性的緩解。
- Auditing large models – 全尺度覆蓋意味著安全分析不再僅限於小型原型;僅在 27 B 參數模型中出現的行為現在也能被檢視。
- Accelerating safety interventions – 開源工具降低了社群開發越獄偵測器、幻覺減少器與對齊檢查的門檻,促進協作式的進步。
研究人員資源
- Download – 完整套件託管於 Hugging Face: https://huggingface.co/google/gemma-scope-2
- Technical report – 詳盡的方法論與評估已記錄於 Gemma Scope 2 論文(PDF 連結見原始貼文)。
- Interactive demo – 線上 Neuronpedia 示範讓使用者在不安裝工具組的情況下探索激活。
- Colab tutorial – 可直接執行的 notebook 引導使用者完成基本分析與視覺化。
未來方向
DeepMind 預期社群將使用 Gemma Scope 2 來:
- 辨識並緩解越獄向量 在即將發布的 LLM 中。
- 研究幻覺機制,透過將內部概念與錯誤輸出相關聯。
- 探索對齊差距,即模型聲稱的推理與其潛在計算之間的落差。
- 根據可解釋性實證洞見,為更安全的訓練方案設計提供資訊。
透過前所未有的方式存取現代語言模型的「大腦」,Gemma Scope 2 旨在使安全關鍵的研究更具可重現性、透明度與影響力。
相關連結
- Gemma 3 model family – https://deepmind.google/models/gemma/gemma-3/
- Original Gemma Scope – https://deepmind.google/blog/gemma-scope-helping-the-safety-community-shed-light-on-the-inner-workings-of-language-models/
- Neuronpedia demo – https://neuronpedia.org/gemma-scope-2
- Technical paper (PDF) – https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/gemma-scope-2-helping-the-ai-safety-community-deepen-understanding-of-complex-language-model-behavior/Gemma_Scope_2_Technical_Paper.pdf