Anthropic 研究:大型生成式模型中的可預測性與驚喜
Anthropic 研究顯示,大型生成式模型——例如 GPT-3、Megatron-Turing NLG 與 Gopher——在廣泛的訓練分佈上表現出可預測的損失(loss),但在特定的能力、輸入與輸出方面卻表現出不可預測的組合,這與直覺相悖。
縮放定律與湧現能力之間的緊張關係
大規模預訓練允許開發者根據縮放定律(scaling laws)來預測模型性能(loss)。雖然損失的高層次可預測性推動了這些模型的快速發展,但這並不等同於特定行為的可預測性。
模型開發者可以預期模型在一般術語下會提升多少,但他們無法輕易預測哪些特定能力會湧現,或者模型會如何回應特定的輸入。這種一般性能趨勢與特定行為不可預測性之間的差距,使得預測部署此類模型的後果變得困難。
風險與政策影響
大型生成式模型的不可預測性為 AI 安全與政策帶來了重大挑戰。由於特定的能力與輸出是不可預測的,模型可能會表現出在部署前難以檢測到的社會有害行為。
Anthropic 指出,這些相互衝突的特性——可預測的縮放但不可預測的行為——影響了開發者部署模型的動機,以及阻礙安全部署的挑戰。研究強調,輸出的不可預測性使得確保模型對所有使用者都是有益且安全的變得困難。
建議的 AI 安全干預措施
為了減輕與不可預測的湧現能力相關的風險,Anthropic 建議 AI 社群必須實施干預措施,以增加大型生成式模型產生有益影響的可能性。該研究旨在作為政策制定者、技術專家以及全方位學術研究人員理解並更有效地監管 AI 系統的資源。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch