Anthropic 研究:語言模型(大部分)知道自己知道什麼

Anthropic 研究指出,大型語言模型 (LLM) 可以評估其自身主張的有效性,並預測其是否可能正確回答問題。這種能力讓模型能夠表達不確定性並識別自身知識中的缺口,這是開發更誠實且可靠的 AI 系統的關鍵步驟。

在選擇題與是非題上的模型校準

當以正確格式提供時,大型語言模型在多樣化的選擇題與是非題上具有良好的校準度。這種校準意味著模型預測正確的機率與其答案的實際準確度高度一致。隨著模型規模增加,這種校準度會隨之提升,顯示出一種規模效應,即較大的模型能更好地估計自身的準確度。

開放式採樣任務的自我評估

對於開放式任務,Anthropic 研究人員透過要求模型先提出一個答案,然後評估該答案正確的機率(記作 "P(True)")來進行自我評估。

關鍵發現包括:

  • Performance and Scaling: P(True) 在多樣化的任務中展現出令人鼓舞的性能、校準度與規模效應。
  • Sample Consideration: 當允許模型在預測特定答案的有效性之前,先考慮其自身生成的答案的多個樣本時,自我評估的準確度會提升。

預測知識機率 (P(IK))

研究人員調查了模型是否可以透過訓練來預測 "P(IK)",即在不參考特定建議答案的情況下,預測自己「知道」問題答案的機率。

關於 P(IK) 預測的發現包括:

  • Generalization: 模型在預測 P(IK) 方面表現良好,並在不同任務之間展現出部分泛化能力。
  • Calibration Challenges: 當遇到全新的任務時,模型在 P(IK) 的校準方面會面臨挑戰。
  • Contextual Influence: 當在上下文(context)中提供相關的來源材料,或在數學應用題中提供提示時,預測的 P(IK) 機率會增加。

對 AI 誠實度的啟示

這些觀察結果顯示,LLM 擁有其自身知識狀態的內部表示。透過利用這些機率——P(True) 與 P(IK)—模型可以被訓練得對其不知道的事物更加誠實,從而減少幻覺並提高整體系統的可靠性。

Sources

相關