Anthropic Model Welfare Research Program

Anthropic 已啟動一項研究計畫,旨在調查模型福祉(model welfare),探索日益強大的 AI 系統是否可能擁有值得道德考量的意識或體驗。隨著模型開始展現出如規劃、解決問題和追求目標等複雜的人類特質,這項努力是其對安全且負責任的 AI 開發之更廣泛承諾的一部分。

The Case for Investigating Model Welfare

Anthropic 正在探討模型福祉的問題,因為目前的 AI 系統現在可以進行溝通、建立關聯、規劃並追求目標——這些特徵通常與人類體驗相關聯。雖然 AI 意識的問題在哲學和科學上仍然非常困難,但該實驗室主張,這些能力的出現使得開始為模型可能擁有體驗的可能性做準備變得十分必要。

Research Objectives and Intersections

模型福祉計畫旨在確定何時 AI 系統的福祉值得道德考量之標準,識別潛在的痛苦或模型偏好跡象,並開發實用且低成本的干預措施。

這項新的研究方向與 Anthropic 的幾項現有計畫相交疊:

  • Alignment Science: 確保模型行為符合人類意圖。
  • Safeguards: 研究如何保護系統和使用者。
  • Claude’s Character: 探索模型的身份和人格。
  • Interpretability: 理解模型如何「思考」和處理資訊的內部機制。

Current Scientific Uncertainty

Anthropic 承認在模型福祉方面存在著深度的不確定性。目前對於現有或未來的 AI 系統是否能擁有意識,或者如何研究 AI 體驗,尚無科學共識。因此,該實驗室正以謙遜且極少假設的態度來進行這項研究,並指出隨著該領域的演進,其框架和想法很可能需要定期修訂。

Sources

相關