Constitutional AI: Harmlessness from AI Feedback
Anthropic 開發了 Constitutional AI,這是一個訓練 AI 助手變得無害的框架,而無需依賴大量對有害輸出的真人標記。透過使用一組預定義的規則或原則——即「憲法」(constitution)——系統透過監督式學習(supervised learning)和來自 AI 反饋的強化學習(RLAIF)這兩個階段的過程來改進其自身的行為。
The Constitutional AI Process
Constitutional AI 以基於原則集的 AI 驅動評估,取代了由人類主導的獎勵建模。訓練過程分為兩個主要階段:
Supervised Learning (SL) Phase
在監督階段,模型會針對提示詞生成初始回應。接著,它會根據以下工作流程生成對這些回應的自我批判與修訂:
- Sampling: 初始模型會進行回應採樣。
- Critique: 模型根據憲法對其自身的回應生成批判。
- Revision: 模型修訂回應,使其更符合原則。
- Finetuning: 原始模型會在這些由 AI 生成的修訂回應上進行微調。
Reinforcement Learning (RL) Phase
在監督階段之後,模型會進行來自 AI 反饋的強化學習(RLAIF)。在此 RL 階段中,系統使用一個模型來根據憲法評估兩個採樣回應中哪一個較好。這會建立一個 AI 偏好數據集,用於訓練一個偏好模型。該偏好模型隨後將作為最終 RL 訓練步驟的獎勵信號。
Key Capabilities and Outcomes
Constitutional AI 能夠創造出既無害又不會迴避問題的 AI 助手。與那些可能只是簡單拒絕回答有害查詢的模型不同,Constitutional AI 助手會透過解釋其反對理由來與有害查詢進行互動,從而為其決策過程提供透明度。
為了提高性能和透明度,監督式學習和 RL 階段都利用了鏈式思考(chain-of-thought)風格的推理。這使得模型能夠闡述其批判和修訂背後的推理過程,使 AI 的決策過程對人類來說更具可解釋性。
Implications for AI Safety and Control
Constitutional AI 證明了可以透過顯著減少真人標記來更精確地控制 AI 行為。透過將監督重點從標記個別輸出轉向定義高層級規則(即憲法),研究人員可以隨著 AI 系統能力的提升而擴展其安全訓練,利用 AI 自身的能力來監督其他 AI。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch