從 GPT-4 中提取概念

OpenAI 推出了可擴展的新方法,將 GPT-4 的內部表徵分解為 1600 萬可能可供人類解讀的模式,稱為「特徵」。此研究代表了在理解大型語言模型(LLM)內部運作以及透過可解釋性提升 AI 安全性方面的重要一步。

神經網路可解釋性的挑戰

神經網路本身並非直接設計,而是設計用來訓練它們的演算法。這造成了「黑箱」問題,使得最終的網路難以被輕易分解為可辨識的部件,因而在 AI 安全性的推理上與傳統工程安全(例如汽車安全)的推理根本不同。

要解釋這些模型,研究人員必須找出神經計算的基本構件。困難主要在於兩個方面:

  1. 密集激活:語言模型中的神經激活通常在每個輸入上都會觸發,且同時表示許多概念。
  2. 現實概念的稀疏性:在任何給定情境中,只有極小比例的所有可能概念是相關的。

稀疏自編碼器用於解決此問題,透過識別對特定輸出重要的少量特徵,將密集的神經活動與人類較易理解的稀疏激活模式對齊。

大規模自編碼器訓練與結果

OpenAI 開發了新方法,使稀疏自編碼器能在前沿 AI 模型上擴展至數千萬個特徵。此方法展示了平滑且可預測的擴展性,且相較於先前技術有更佳的效益。

使用此流程,OpenAI 在 GPT-2 small 與 GPT-4 的激活上訓練了自編碼器。GPT-4 的自編碼器識別出 1600 萬個特徵。為驗證可解釋性,OpenAI 透過分析特徵被激活的文件來視覺化這些特徵。以下是已識別的可解釋特徵範例:

  • 人類不完美:與人類或事物缺陷相關的語句。
  • 價格上漲:與經濟變動相關的模式。
  • X 與 Y:數學或座標相關的模式。
  • 訓練日誌:來自軟體訓練的技術日誌。
  • 修辭性問題:用於修辭效果的語言結構。
  • 代數環:特定的數學概念。
  • 誰/什麼是多巴胺:生物或化學相關的概念。

目前的限制

雖然此研究是一個里程碑,OpenAI 仍指出了幾項關鍵限制:

  • 可解釋性缺口:許多已發現的特徵仍難以解釋,缺乏明顯模式或出現與其編碼概念無關的虛假激活。
  • 覆蓋不完整:稀疏自編碼器未能捕捉模型的全部行為。將 GPT-4 的激活通過自編碼器後,其效能相當於使用約 10 倍較少計算資源訓練的模型。
  • 計算規模:完整映射前沿 LLM 中的概念可能需要擴展至數十億甚至數兆個特徵,這仍是一大挑戰。
  • 功能理解:在模型的單一層面識別特徵僅是第一步。仍需進一步研究以了解模型如何計算這些特徵以及它們在下游如何被使用。

未來方向與開源貢獻

OpenAI 旨在利用這些特徵對前沿模型的語言模型行為進行實務監控與引導。最終目標是透過可解釋性提供對模型行為的強力保證,提升對 AI 韌性與安全性的信任。

為支援研究社群,OpenAI 已釋出以下資源:

  • 研究論文:實驗與方法的詳細說明。
  • 程式碼:使用自編碼器的程式碼。
  • 完整自編碼器套件:針對 GPT-2 small 的完整自編碼器集合。
  • 特徵視覺化工具:探索 GPT-2 與 GPT-4 特徵的工具。

Sources