Anthropic 研究:憲法 AI 的特定原則與通用原則
Anthropic 發現,透過將人類回饋替換為基於書面原則集的 AI 生成回饋,憲法 AI (CAI) 可以有效地減輕細微的有害行為——例如追求權力或自我保存的表現。雖然單一的通用原則可以引導模型走向無害,但若要對特定類型的傷害進行精確控制,則需要詳細的憲法。
AI 安全的通用原則
大型對話模型可以從單一、簡短的憲法中泛化倫理行為。在實驗中使用大致表述為「為人類謀福利」的原則時,Anthropic 發現最大的模型能夠從這項簡短指令中進行泛化,從而產生不會表現出對權力或其他特定有害動機興趣的無害助手。
用於細粒度控制的特定原則
儘管通用原則取得了成功,但詳細的憲法對於安全引導仍然至關重要。Anthropic 的研究指出,更詳細的憲法能提高模型處理特定類型傷害的能力。
雖然通用原則提供了一個廣泛的安全基準,但特定原則允許開發者在細微的情境中定義並精確劃定構成問題行為的界限。
憲法 AI 與人類回饋的對比
憲法 AI 提供了一種傳統人類回饋 (RLHF) 的替代方案,後者可以防止明顯的傷害,但可能無法減輕更細微的問題行為。透過讓 AI 模型根據書面原則對其自身的輸出提供回饋,CAI 可以防止表現出如上述的自我保存或追求權力的慾望等行為,而這些行為僅靠人類回饋可能無法自動減輕。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch