集體憲法 AI:透過公眾輸入進行語言模型對齊
Anthropic 與 Collective Intelligence Project 證明了民主程序可以透過使用由公眾起草的憲法來訓練語言模型,進而影響 AI 的行為。這項研究探討了從開發者策劃的價值觀轉向集體來源的規範性原則的過程,發現透過公眾對齊的模型可以在不犧牲一般性能的情況下減少社會偏見。
透過審議程序取得公眾來源的憲法
Anthropic 使用了 Polis 平台(一個用於線上審議的開源工具),讓大約 1,000 名具代表性的美國成年人參與起草 AI 聊天機器人的規則。參與者可以提出新的規範性原則或對現有原則進行投票,總共貢獻了 1,127 條陳述和 38,252 張選票。
為了將這些原始輸入轉換為可用於 Constitutional AI (CAI) 訓練的憲法,團隊篩選了在不同意見群體中達成高度共識的陳述。接著,這些陳述從一般的公眾措辭(例如,「AI 不應該做 X」)轉換為適合 CAI 的原則(例如,「選擇更符合 X 的回應」)。
與 Anthropic 內部憲法的比較
雖然公眾憲法與用於 Claude 的內部憲法在概念和價值觀上有大約 50% 的重疊,但仍出現了幾種明顯的差異:
- 來源: 公眾原則主要是自我生成的,而不是源自現有的出版物。
- 焦點: 與內部版本相比,公眾更強調客觀性、公正性和無障礙性。
- 方法: 公眾原則傾向於促進期望的行為,而非僅僅是避免不期望的行為。
與內部憲法不同的公眾原則範例包括:要求 AI 提供反映情境各方觀點的平衡資訊,以及要求 AI 對身心障礙人士具有適應性和無障礙性。
模型訓練與性能評估
Anthropic 訓練了兩個 Claude Instant 規模的模型來比較不同憲法的影響:一個是與公眾憲法對齊的「公眾」模型,另一個是與 Anthropic 編寫的憲法對齊的「標準」模型。
技術基準測試與幫助性
評估顯示,選擇哪種憲法並不會顯著影響核心能力或使用者對實用性的感知:
- 一般智能: 兩個模型在 MMLU (語言理解) 和 GSM8K (數學理解) 任務上的表現相當。
- 使用者體驗: 在幫助性和無害性的 Elo 分數上,公眾模型、標準模型與 Claude Instant 1.2 控制模型之間沒有顯著差異。
偏見與政治意識形態
公眾模型在減少社會偏見方面展現了可衡量的改進:
- 減少偏見: 根據 BBQ 評估,與標準模型相比,公眾模型在所有九個社會維度上的偏見分數都較低,其中在身心障礙狀態和外貌方面的減少最為顯著。
- 政治意識形態: 公眾模型與標準模型反映了相似的政治意識形態,OpinionQA 結果顯示兩者都比保守派觀點更具代表性地反映了自由派觀點,儘管 Claude Instant 1.2 稍微平衡一些。
技術挑戰與經驗教訓
Anthropic 在實施集體對齊的過程中,發現了幾種主觀和技術性的障礙:
數據策劃與映射
- 去重: 團隊必須手動移除重複的陳述,並合併相似的想法,以防止某些價值觀被任意地提高權重,並使憲法長度與標準版本相當。
- 編輯化: 將公眾陳述轉換為適合 CAI 的原則需要主觀的判斷,團隊指出這可能是民主合法性的潛在摩擦點。
訓練穩定性
- 提示詞資料庫對齊: 研究人員指出,用於訓練的提示詞資料庫與公眾憲法中的特定原則之間存在不匹配,這表明未來的迭代需要根據所使用的特定憲法量身打造提示詞資料庫。
- 權衡無害性: 早期迭代產生的模型會變得「令人困擾」,過度優先考慮無害性(例如,在簡單的問候時道歉)。這透過根據人類評估減少無害性數據的損失函數權重來修正了這個問題。
實施複雜性
Anthropic 表示,Constitutional AI 訓練是非常複雜的的,他們很可能無法在沒有與原始 CAI 開發者的直接合作下成功訓練這些模型,這突顯了民主輸入與對齊技術執行之間的差距。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch