Claude's Constitution: Implementing Constitutional AI for Model Alignment
Anthropic 開發了「憲法 AI」(Constitutional AI, CAI),這是一種透過書面憲法為語言模型提供明確價值觀的訓練方法。這種方法允許 AI 根據透明的原則來決定適當的參與方式和行為界限,使得系統的價值觀比從大規模人類回饋中隱含得出的價值觀更容易理解和調整。
The Limitations of Human-Centric Feedback
傳統的模型對齊(model alignment)通常依賴人類承包商將模型輸出與其他輸出進行比較,並根據「助人性」或「無害性」等原則來選擇「較好」的回答。Anthropic 指出這種方法有三個主要缺點:
- Human Exposure: 人類審查員可能需要接觸到令人不安或創傷性的內容。
- Scalability: 隨著模型產生的回應愈發複雜,群眾外包人員(crowdworkers)很難跟上或完全理解這些輸出。
- Resource Intensity: 審查輸出子集的所需時間和資源,使得許多研究人員無法參與此過程。
How Constitutional AI Works
Constitutional AI 以 AI 回饋來取代人類監督,用以評估輸出。系統受一套規範性原則(constitution)的引導,以避免有毒或歧視性的輸出,並防止協助非法或不道德的活動。
CAI 的訓練過程分為兩個不同的階段:
- Critique and Revision: 模型被訓練使用憲法原則和一些提供的範例來批判並修改自己的回應。
- Reinforcement Learning (RL): 模型不再使用人類回饋,而是透過 RL 使用基於憲法的 AI 生成回饋來選擇更無害的輸出。
Anthropic 報告稱,CAI 可以產生「Pareto improvement」,即模型變得比透過人類回饋強化學習(RLHF)訓練的模型既更助人又更無害。在測試中,經過 CAI 訓練的模型在面對對抗性輸入時能做出更適當的回應,且不會變得迴避,完全透過 AI 監督實現了這些無害性結果。
Composition of Claude's Constitution
Claude 的憲法是一套不斷演進的原則集合,其來源多樣化,以確保價值觀系統的廣泛性和包容性。這些來源包括:
- The UN Declaration of Human Rights: 用於涵蓋廣泛的核心人類價值觀。
- Global Platform Guidelines: 受 Apple 的服務條款啟發,旨在處理現代數位議題,如數據隱私和網路冒充。
- Frontier AI Research: 納入了其他實驗室的最佳實踐,例如 DeepMind 的 Sparrow Principles。
- Non-Western Perspectives: 專門設計的原則,旨在確保模型不會僅僅反映西方、富裕或工業化文化的觀點。
- Empirical Research: 透過試錯法開發的原則,以優化泛化能力和有效性。
Balancing Ethics and User Experience
Anthropic 發現 CAI 訓練的模型偶爾會變得「具批判性或令人討厭」。為了應對這一點,他們整合了鼓勵比例適當的回應原則,指示模型在保持倫理和道德的同時,不要聽起來「過度居高臨下、反應過度、令人厭惡或譴責性」。
Implementation and Future Directions
在訓練過程中,模型並不會針對每個回應參考每一條原則。相反地,它會在監督式學習階段(Critique and Revision)和強化學習階段(Evaluation)中,隨機抽取一條原則。
Anthropic 將 Constitutional AI 視為一種讓 AI 價值觀系統變得明確且可更改的方法。該實驗室正在探索更民主的方法來制定憲法,以及為特定使用案例提供可定制的憲法之可能性,以避免強加單一的政治意識形態或觀點。
Sources
- OriginalClaude’s Constitution
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch