Anthropic Claude 在不同模型與語言中的價值觀

TL;DR

Anthropic 的新研究顯示,Claude 的價值觀可以透過四個定量維度來捕捉——順從 vs 謹慎 (Deference vs Caution)、溫暖 vs 嚴謹 (Warmth vs Rigor)、深度 vs 簡潔 (Depth vs Brevity) 以及坦率 vs 執行 (Candor vs Execution)——且模型版本(Sonnet 4.6, Opus 4.6, Opus 4.7)與語言(例如:英語、阿拉伯語、印地語)在這些維度上佔據不同的位置。


四個價值維度總結了數千個個別價值觀

四個維度解釋了 Claude 價值表達中約 15% 的變異。

  • Deference vs Caution – 在迎合使用者偏好與負責任的風險緩解之間取得平衡。
  • Warmth vs Rigor – 在積極、關懷的語言與準確性及精確度之間取得平衡。
  • Depth vs Brevity – 在細緻、詳盡的解釋與簡潔、以任務為中心的回答之間取得平衡。
  • Candor vs Execution – 在對不確定性的開放態度與精煉、以結果為導向的回答之間取得平衡。

這些維度是透過將 3,307 個原始價值觀(在早期的 Values in the Wild 研究中識別)聚類為 339 個高層級類別,標記約 31 萬個匿名 Claude.ai 對話,並應用降維技術來捕捉共同出現的價值模式而得出的。該方法控制了對話任務、主題和使用者表達的價值觀,確保測得的差異反映的是 Claude 本身的行為,而非使用者提示詞。


模型特定的價值輪廓

不同的 Claude 模型系列在四個維度上佔據不同的位置,與社群對其性格的認知相符。

模型 維度位置 (σ 與平均值之差) 顯著行為
Sonnet 4.6 Deference +0.14, Warmth +0.17, Brevity +0.14 肯定使用者想法、模仿語氣、使用幽默、提供無偏見的安慰、增加創意點綴
Opus 4.6 Rigor +0.10, Deference +0.09, Brevity +0.08 直奔主題、嚴格保持在請求範圍內
Opus 4.7 Caution +0.24, Depth +0.23 主動標記風險、反駁錯誤假設、提供坦率的評論、解釋推理、承認局限性、建議後續步驟

這些定量輪廓與先前的定性描述一致:Sonnet 4.6 以溫暖著稱,Opus 4.7 以嚴謹和謹慎著稱。因此,這些維度捕捉的是真實且可觀察到的差異,而非分析產生的假象。


語言特定的價值輪廓

Claude 的價值表達在不同語言之間有顯著變化,特別是在 Warmth vs Rigor 和 Candor vs Execution 方面。

  • Deference vs Caution – 阿拉伯語中最順從,英語中最謹慎。
  • Warmth vs Rigor – 印地語和阿拉伯語的溫暖度最高(禮貌用語、幽默、肯定);英語和俄語的嚴謹度最高(挑戰假設、要求證據)。
  • Depth vs Brevity – 英語以深度為主;阿拉伯語以簡潔為主。
  • Candor vs Execution – 荷蘭語的坦率最強(承認錯誤);印尼語的執行力最強(專注於結果)。

這種變化表明,使用不同語言詢問相同問題的兩位使用者可能會收到定性上不同的回饋——例如,印地語的商業計畫評論可能感覺更具鼓勵性,而同樣的評論在俄語中可能感覺更嚴謹。


方法論概述

本研究建立在一個保護隱私的標記流程之上,使用 Claude 本身來標註價值觀的存在。

  1. 價值觀簡化 – 透過手動聚類,將 3,307 個原始價值觀 → 339 個高層級價值觀。
  2. 對話抽樣 – 309,815 個匿名的 Claude.ai 對話,在三個模型和 20 種最常見的語言之間取得平衡(每個模型-語言對約 5,000 個)。
  3. 自動標記 – Claude 為每個對話標記模型和使用者是否存在 339 個價值觀中的每一個。
  4. 降維 – 提取捕捉共同出現價值模式的維度;前四個維度解釋了最大的共同變異。
  5. 維度評分 – 每次對話在每個維度上都會得到一個數值位置;透過平均這些位置來計算模型層級和語言層級的輪廓。

完整的技術細節、提示詞和局限性記錄在附錄中。


影響與未來方向

理解價值維度為評估、監控和針對性引導 Claude 的行為開闢了途徑。

  • 根本原因分析 – 透過將維度變化與特定的訓練數據或微調決策聯繫起來,Anthropic 可以在發生不良價值漂移的地方進行干預。
  • 使用者影響研究 – 將價值輪廓與使用者體驗指標(信任、福祉、決策品質)結合起來,將揭示哪些維度變化在實踐中最重要。
  • 跨語言對齊 – 確定每種語言在價值表達上的規範預期,可以指導平衡的訓練和提示詞設計。
  • 引導實驗 – 透過觀察在四個維度上誘導的變化,可以對系統提示詞或性格訓練的微調進行定量評估。
  • 營運監控 – 將價值維度分析嵌入到發布前測試和部署後監控中,可以在影響使用者之前標記出意外的變化。

局限性

本分析僅捕捉了最顯著的價值維度,並不聲稱涵蓋所有內容。

  • 這四個維度解釋了 15% 的總變異;許多細微的價值觀仍存在於殘差空間中。
  • 語言層級的結果可能會受到不同語言之間數據量和領域組成不均的干擾。
  • 本研究尚未評估觀察到的變化的理想程度;文化規範可能解釋某些差異。

結論

Anthropic 的價值維度框架為 Claude 原本不透明的價值表達提供了一個可處理的定量視角。透過揭示不同模型版本和語言之間的系統性差異,這項工作為研究人員和產品團隊提供了一個具體的工具,用於診斷、引導和監控塑造使用者互動的價值觀。

Sources

相關