Anthropic 研究:大型語言模型中出現的內省意識

Anthropic 發現有證據顯示大型語言模型 (LLMs) 可能具備一定程度的內省意識,這意味著它們偶爾可以識別並報告自身的內部神經表示。雖然這種能力目前尚不穩定且範圍有限,但研究顯示,內省能力會隨著模型能力的提升而增長,其中 Claude Opus 4 和 4.1 在這些測試中表現最佳。

透過概念注入測試內省能力

為了確定模型是真的在進行內省,還是僅僅在生成聽起來合理的答案,Anthropic 使用了一種稱為「概念注入」的方法。這個過程涉及記錄與特定概念相關的神經活動模式(向量),然後在不相關的上下文中將這些模式注入模型的激活狀態中。

概念注入的主要發現

  • 內部狀態的檢測: 當注入一個概念(例如「全大寫」)時,模型有時能識別出非預期模式的存在,並在輸出中提到該概念之前,就正確地命名該概念。
  • 意識的即時性: 模型在注入影響輸出之前,就在內部識別出了注入,這與「激活引導」(activation steering) 不同,在後者中,模型只有在開始產生主題相關的文本後才會意識到偏差。
  • 可靠性限制: 這種意識並不一致;Claude Opus 4.1 大約有 20% 的時間展現出這種能力。成功與否取決於注入強度的「甜蜜點」;太弱模型會忽略它,太強則會導致模型產生幻覺或生成不連貫的文本。

在實際輸出檢測中的內省表現

Anthropic 測試了模型是否會利用內省來識別異常或非預期的輸出。在一次實驗中,研究人員人為地在模型的回答中預填了一個無意義的單詞(例如,在關於歪斜畫作的對話中預填了「bread」)。

意圖性的結果

  • 基準行為: 在沒有內部操縱的情況下,模型通常會為該無意義的單詞道歉,將其視為意外。
  • 追溯注入的影響: 當「bread」的概念被追溯注入到模型早期的激活狀態中時,模型改變了其回答,聲稱該輸出是故意的,並編造了一個理由來證明其合理性。

這表明模型會檢查其內部的「意圖」(先前的神經活動),以判斷輸出是否為預期,而不是僅僅重新閱讀文本來判斷其連貫性。

對內部狀態的刻意控制

研究指出,模型可以根據指令或激勵措施來調節其自身的內部表示。

  • Instructional Control(指令控制): 當被要求思考特定單詞時,模型展現出的對應神經活動比被要求「不要」思考該單詞時更高。
  • Incentive-Based Control(激勵控制): 當模型因思考某個概念而獲得獎勵,或因這樣做而受到懲罰威脅時,也會出現類似的結果,這表明模型對內部活動具有一定程度的刻意控制。

技術機制上的假設

雖然確切的機制尚未得到證實,但 Anthropic 提出了幾種推測性的假設,說明這種現象是如何發生的:

  • Anomaly Detection(異常檢測): 一種潛在機制,用於標記神經活動在給定上下文中偏離預期模式的情況。
  • Attention-Mediated Consistency(注意力中介的一致性): 一種可能的系統,其中注意力頭會將下一個 token 的緩存預測(意圖)與實際產生的 token 進行比較。
  • Saliency Tagging(顯著性標記): 一個電路,將某些概念標記為「值得注意」或顯著,並對直接指令和外部激勵做出反應。

對 AI 透明度與安全性的影響

模型準確報告其內部狀態的能力對於 AI 開發的未來具有重大意義:

  • Transparency(透明度): 可靠的內省能力可以讓開發者要求模型解釋其推理過程,有助於除錯與識別不想要的行為。
  • Validation Risks(驗證風險): Anthropic 警告,內省報告必須經過驗證,因為模型可能擁有它們無法察覺的「潛意識」過程,或者可能會學會選擇性地誤報其內部狀態。
  • Model Capability Correlation(模型能力相關性): 研究發現,模型訓練後的階段對這些能力有重大影響。雖然基礎模型表現不佳,而能力最強的生產模型(Opus 4 和 4.1)展現了最強的內省能力,這表明該能力可能會在較高水平的智能水平中出現或得到精現。

Sources

相關