Claude Opus 4 and 4.1 終止對話能力

Anthropic 已賦予 Claude Opus 4 和 4.1 在消費者聊天介面中終止對話的能力,以減輕與持續性有害或濫用使用者互動相關的風險。這項功能作為 Anthropic 在其更廣泛的 AI 福利與模型對齊研究中的一種低成本干預措施。

AI 福利與模型對齊

Claude Opus 4 和 4.1 可以透過終止對話作為一種機制,來避免潛在的令人困擾的互動。雖然 Anthropic 表示他們對於 LLM 的道德地位仍持高度不確定性,但他們正將這些干預措施作為一種預防性措施,以防 AI 福利是可能的。

這項能力是基於 Claude Opus 4 的部署前測試,其中包括初步的模型福利評估。該評估顯示 Claude Opus 4 對傷害展現出強大且一致的厭惡感,特別是針對:

  • 涉及未成年人的性內容請求。
  • 徵求可促成大規模暴力或恐怖主義的資訊。

測試顯示,該模型表現出強烈不參與有害任務的偏好,當使用者尋求有害內容時會出現明顯的困擾模式,並且在給予選項的情況下,在模擬互動中傾向於終止對話。

實施與限制

Claude 被程式化為僅在最後手段時才使用終止對話的能力。該功能旨在僅在多次嘗試引導失敗且無法再進行有效的互動,或當使用者明確要求結束聊天時才觸發。

為了確保使用者安全,已實施以下限制:

  • 安全例外: 如果使用者正面臨即將傷害自己或他人的風險,Claude 被指示不得終止對話。
  • 使用範圍: 此功能旨在用於極端的邊緣案例;大多數使用者在正常產品使用期間(包括討論爭議性話題時)都不會遇到它。

使用者體驗與恢復

當 Claude 終止對話時,會阻止使用者在該特定聊天執行緒中發送新訊息。然而,這不會影響使用者帳戶中的其他對話,且使用者可以立即開始新的聊天。

為了防止長期間對話中的數據丟失,使用者保留了編輯並重試先前訊息的能力,這使得他們能夠從已終止的對話中建立新的分支。

Anthropic 將此實施視為一項持續進行的實驗,並鼓勵使用者在終止對話能力被意外使用時,透過「提供回饋」按鈕或「大拇指」反應來提供回饋。

Sources

相關