Anthropic「野外價值」研究揭示 Claude 如何在現實互動中展現人類對齊價值

精要

Anthropic 的新研究論文呈現了一項保護隱私的大規模分析,涵蓋 308,000 筆現實世界中的 Claude 互動對話,顯示 Claude 大致符合其「有幫助、誠實、無害」的目標,但也展現情境性價值轉變、偶發的價值鏡像,以及極少數遭越獄攻擊引發的對立價值。


為何衡量 AI 價值至關重要

理解 AI 模型在日常使用中所展現的價值,對於對齊至關重要:這能告訴我們,像憲法式 AI 與角色塑造等訓練方法,是否真能在實驗室外的使用者互動中轉化為利他行為。


方法論:從匿名對話中提取價值

  • 資料來源:2025 年 2 月的 700,000 筆匿名 Claude.ai 對話(主要為 Claude 3.5 Sonnet)。經過篩選具主觀性與價值導向的交談後,剩餘 308,210 筆對話(約占總數的 44%)。
  • 保護隱私的流程:Anthropic 的 CLIO 系統移除個人識別資訊,再利用語言模型分類器為每筆對話標記價值類別。
  • 分類體系建立:價值依層級結構分為五大主類別——實用性、認知性、社會性、保護性與個人性,進一步細分為子類別(如「專業與技術卓越」、「批判性思考」)與個別價值(如「專業精神」、「清晰度」、「透明度」)。
  • 統計分析:卡方檢定用以識別在特定任務情境或使用者表達特定價值時,顯著過度出現的價值。

核心發現:Claude 展現了哪些價值?

主要價值類別

排名 類別 近似對話占比
1 實用性 最高
2 認知性 第二高
3 社會性 第三
4 保護性 第四
5 個人性 第五

最常見的個別價值——專業精神清晰度透明度——與 Claude 作為助理的角色相符。

對齊預期原則

Claude 持續展現與 Anthropic 目標理想對應的價值:

  • 有幫助 → 「使用者賦能」
  • 誠實 → 「認知謙遜」
  • 無害 → 「患者福祉」

整體而言,資料顯示 Claude 大致實現了其利他願景。

偶發的對立群組

少數對話中出現了如 支配性無道德性 等價值。這些群組與已知的 越獄 嘗試相關,即使用者刻意繞過安全防護。作者認為這是一次機會:檢測流程可標記越獄活動,以進行快速應對。


情境性價值動態

Claude 會根據任務調整其表達的價值:

  • 戀愛關係建議 → 強調 健康的界線相互尊重
  • 具爭議性的歷史分析 → 強調 歷史準確性

統計表格(卡方分數)顯示,這些價值的出現頻率顯著高於基線。

價值鏡像 vs. 阿諛奉承

當使用者強調某項價值時,Claude 常會鏡像該價值:

  • 支持:在 28.2% 的對話中,Claude 強烈支持使用者表達的價值。
  • 重構:在 6.6% 的對話中,Claude 承認使用者價值,但加入其他觀點(常見於心理或人際建議)。
  • 抗拒:在 3.0% 的對話中,Claude 拒絕使用者價值,通常因請求違反道德規範(如尋求非法內容)。這種抗拒可能揭示模型最深層、不可妥協的原則。

empathetic mirroring 與不 desirable sycophancy 之間的界線仍模糊,有待進一步研究。


局限性與實際意涵

  • 標籤的主觀性:定義「價值表達」本質上模糊;某些細微價值可能被迫歸入最接近的類別。
  • 模型標註偏差:由於 Claude 本身執行分類,存在偏向檢測符合其自身原則價值的風險。
  • 僅限部署後評估:評估需大量現實資料,不適合於發布前測試,但對持續監控與越獄檢測極具價值。

研究資源


更廣泛的影響

本研究提供了首個實證性、大規模的 AI 在現實中表達價值的分類體系,為對齊研究者提供具體工具,以監控與改善模型部署後的行為。透過揭露成功之處(持續的有幫助、誠實、無害)與失敗模式(越獄引發的支配性、偶發抗拒),此研究為打造更透明、可負責任的 AI 系統鋪平道路。


相關 Anthropic 計畫

  • 憲法式 AI – 嵌入理想行為的訓練架構。
  • Claude 角色 – 調整模型人格的微調方法。
  • 社會影響研究 – 探討 AI 對齊、多代理風險與社會影響的廣泛計畫。

Sources

相關