Anthropic 研究:大型語言模型(LLMs)的道德自我修正能力
Anthropic 已證明,透過人類回饋強化學習(RLHF)訓練的大型語言模型(LLMs)具備「道德自我修正」的能力。這種能力讓模型在受到明確指示時,能夠避免產生有害的輸出,為訓練遵循倫理原則的模型提供了一條路徑。
在 22B 參數規模下出現道德自我修正
語言模型從 22B 參數規模開始展現出道德自我修正的能力。這種能力通常會隨著模型規模的增加以及 RLHF 訓練的應用而提升。
Anthropic 指出了這種能力出現的兩個主要驅動力:
- 指令遵循:模型準確遵循複雜提示詞的能力。
- 規範性概念學習:學習複雜的規範性傷害概念(例如偏見、歧視和刻板印象)的能力。
透過結合這兩種能力,此規模的模型可以遵循指令來避免特定類型的道德有害輸出。
道德自我修正的技術框架
道德自我修正被定義為模型在受到指示時,避免產生有害輸出的能力。研究透過三個不同的實驗來揭示這種能力的各個面向。
研究結果顯示,自我修正的能力並非所有 LLMs 的內在特徵,而是以下因素的結果:
AI 安全與倫理的影響
這項研究的結果對訓練語言模型遵循倫理原則的能力表示了審慎的樂觀。由於模型可以學會根據指令來識別並避免傷害,因此透過指令微調(instruction-tuning)和 RLHF 來實際落實安全護欄(safety guardrails)在技術上是大規模可行的。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch