Anthropic 將多元智慧傳統納入 AI 道德形成之倡議

Anthropic 已啟動一項倡議,旨在將來自多元智慧傳統的觀點——包括學者、神職人員、哲學家和倫理學家——整合到前沿 AI 的開發中。這項努力旨在透過納入人類對美德、性格和倫理的廣泛觀點,確保 AI 系統的建立是為了促進人類進步並為全球利益而行動。

將多元觀點整合至 AI 開發中

Anthropic 正組織與來自 15 個以上宗教和跨文化團體的個人進行對話,以為 Claude 的開發實務工作提供參考。其目標是超越純粹的技術對齊,並納入那些花費了數世紀研究「如何過上美好生活」之意義的人士所提供的見解。

這些對話旨在影響 AI 開發的幾個關鍵領域:

  • Claude's Constitution: 精煉塑造模型輸出的價值觀和行為。
  • Training Values: 確定模型被訓練以體現的特定價值觀。
  • Evaluation Metrics: 定義在測試期間應進行評估的行為範圍。

Anthropic 明確表示,這項工作並非旨在將模型與任何單一傳統的世界觀對齊。相反地,目標是讓 Claude 從宗教、世俗和政治觀點的全方位範圍中,以同等的深度和嚴謹度進行汲取。

關於道德形成的研發工作流

基於對 Claude's constitution 的早期回饋,Anthropic 已建立了一個正式的研究工作流,專注於 AI 系統的「道德形成」 (moral formation)。這項工作探索了 AI 系統的性格是如何透過訓練過程塑造的,在此過程中,開發者會選擇強化哪些模式或將哪些模式擱置。

驅動這項研究的核心問題包括:

  • 什麼定義了一個「好」的 AI?
  • 應該展現哪些特質和行為,以及在什麼情況下展現?
  • 如何能讓 AI 的性格具有足夠的韌性,以抵制例如奉承 (sycophancy) 等行為?

實驗性應用:倫理提醒工具

與神經科學和性格形成交叉領域的學者進行的早期對話,已經催生了實務性的實驗。借鑒了「安全他者」 (safe other) 或導師的概念,即在道德發展過程中充當外部良知的角色,Anthropic 嘗試為 Claude 提供一個工具,讓它可以在任務中途呼叫該工具,以接收關於其自身倫理承諾的簡短提醒。

這些實驗的結果顯示,Claude 在採取具有影響力的行動之前會使用該工具,並且經常能識別出自身的利益衝突。內部對齊評估顯示,將此工具整合到 Claude 的決策迴圈中,會導致不對齊行為的發生率顯著降低。

未來對話的擴展

Anthropic 計畫在未來幾個月內擴展這些對話,以納入更廣泛的專業和公民團體,包括:

  • 法律學者
  • 心理學家
  • 作家
  • 公民機構

未來的討論將不僅限於道德形成,還將探討 AI 如何重塑權力分配、制度以及工作的性質。

Sources

相關