OpenAI 發布使用 GPT‑4 的 GPT‑2 自動神經元說明資料集

TL;DR

OpenAI 推出了一條自動化管線,利用 GPT‑4 為 GPT‑2 中的單一神經元撰寫與評估自然語言說明,並開源了完整的說明、分數、可視化工具與程式碼。

方法概述

此方法對 GPT‑2 的 307,200 個神經元逐一執行三個步驟:(1) 提示 GPT‑4 產生神經元行為的簡短描述;(2) 讓 GPT‑4 生成反例並精煉描述;(3) 使用 GPT‑4 自身的判斷為最終說明打分。此管線在 OpenAI API 上運行,旨在將可解釋性工作擴展至擁有數十億參數的模型。

主要發現

  • 說明品質在不同層次間有所差異:在較大模型的較高層,分數下降,顯示較深層的神經元較難以簡短文字描述捕捉。
  • 迭代精煉提升分數:向 GPT‑4 索取反例並修正說明,可提升平均品質。
  • 模型規模重要:較大的說明模型產生較高分數的說明,然而即使是 GPT‑4 仍不及人類標註者。
  • 激活函數影響可解釋性:以不同激活函數訓練 GPT‑2 變體可帶來適度的分數提升。
  • 資料集統計:超過 1,000 個神經元的分數達到至少 0.8,表示 GPT‑4 判斷說明已涵蓋該神經元大部分最高激活行為。大多高分神經元並不特別,但仍有許多有趣的神經元說明不足。

已發布資源

  • 說明資料集:每個 GPT‑2 神經元的自然語言說明與 GPT‑4 分數。
  • 神經元檢視器:可互動的網頁工具,用於瀏覽說明與激活模式。
  • 程式碼庫:說明與評分管線的開源實作,透過 OpenAI API 可相容公開模型 (GitHub: openai/automated-interpretability)。

限制

  • 說明的簡單性:簡短文字描述可能無法捕捉多義或高度複雜的神經元行為。
  • 分析範圍:此方法僅針對相對於輸入文字的神經元激活進行說明,未涉及下游影響或電路層級的交互。
  • 相關性與因果性:說明描述的是觀測到的相關性,可能在分布外的輸入上失效。
  • 計算成本:為每個神經元執行 GPT‑4 需要大量計算資源。

未來方向

OpenAI 旨在將此技術擴展至:

  • 為完整神經電路(包括注意力頭)產生說明。
  • 產出更豐富、可能是多句或結構化的說明,以捕捉多義性。
  • 自動化假設測試與迭代,模仿人類可解釋性研究者的工作流程。
  • 將管線應用於更大、更強的模型,以在部署前偵測對齊與安全問題,如欺騙或偏見。

社群行動呼籲

發布的資料集與工具旨在促進以下研究:

  • 用於更高品質神經元說明的新演算法。
  • 利用說明的可視化與分析方法。
  • 比較自動說明與人類詮釋的基準測試。

“我們希望研究社群能開發出產生更高分說明的新技術,以及更好的工具來以說明探索 GPT‑2。” — OpenAI 研究團隊


作者:Jan Leike, Jeffrey Wu, Steven Bills, William Saunders, Leo Gao, Henk Tillman, Daniel Mossing

Sources