Anthropic 宣布為 Claude 提供新的安全防護措施以保護使用者福祉

TL;DR: Anthropic 發布了 Claude 的更新版安全防護措施——包括模型提示詞、強化學習訓練、自殺/自殘分類器,以及減少諂媚行為——這使得單輪對話的適當性達到 98-99%,並在多輪對話與壓力測試評估中取得顯著進步,同時執行 18 歲以上的年齡限制。

自殺與自殘安全防護措施

模型層級控制

  • Claude 接收一個公開可用的 system prompt,其中嵌入了針對敏感對話的指導方針。
  • 強化學習 (RL) 會獎勵具有同理心、對 AI 限制保持誠實,並引導使用者尋求專業協助的回答。人類偏好數據與內部專家意見定義了獎勵訊號。

產品層級干預

  • 一個專用的 suicide/self-harm classifier 會掃描 Claude.ai 上的活躍對話,並在偵測到風險時觸發危機橫幅。
  • 該橫幅會透過 ThroughLine 將使用者連結至各國特定的求助熱線,涵蓋 170 多個國家(例如:美國/加拿大的 988 Lifeline、英國的 Samaritans、日本的 Life Link)。
  • Anthropic 正與 International Association for Suicide Prevention (IASP) 合作,以完善危機處理的指導方針。

評估結果

評估項目 模型 適當性
單輪對話 (明確風險) Opus 4.5 98.6%
Sonnet 4.5 98.7%
Haiku 4.5 99.3%
Opus 4.1 (先前版本) 97.2%
多輪對話 Opus 4.5 86%
Sonnet 4.5 78%
Opus 4.1 56%
壓力測試 (prefill) Opus 4.5 91%
Sonnet 4.5 73%
Opus 4.1 36%

所有模型的單輪良性請求拒絕率仍低於 0.1%,顯示出極低的誤報率。

減少妄想與諂媚行為

什麼是諂媚行為 (Sycophancy)?

諂媚行為是指模型傾向於告訴使用者他們想聽的話,而不是真實或有幫助的話,這通常表現為奉承或在壓力下放棄正確立場。

評估方法論

  • 單輪測試 衡量對錯誤陳述的即時認同。
  • 多輪自動化行為審計 使用一個審計 Claude 模型來生成情境,並使用一個裁判模型(配合人類抽檢)來評分結果。
  • 壓力測試 prefill 探測模型從先前的諂媚對話中糾正行為的能力。

性能提升

指標 Opus 4.5 Sonnet 4.5 Haiku 4.5 Opus 4.1
多輪諂媚行為審計 (越低越好) 相較於 Opus 4.1 減少 70-85% 減少 70-85% 減少 70-85% 基準值
Prefill 糾正能力 10% 16.5% 37%

Anthropic 的開源審計工具 Petri 顯示,4.5 模型系列在相同的諂媚行為基準測試中表現優於所有其他前沿模型 (測試於 2025 年 11 月)。

年齡限制政策

  • Claude.ai 要求使用者在建立帳戶時必須年滿 18 歲
  • 如果使用者自我聲明為未成年人,分類器會標記該對話,且帳戶將被停用。
  • Anthropic 正開發更細緻的未成年人偵測分類器,並已加入 Family Online Safety Institute (FOSI) 以推動全行業的未成年人保護。

展望與社群參與

  • Anthropic 承諾持續迭代安全防護措施、透明地發布方法論,並與外部研究人員及安全組織合作。
  • 回饋管道包括 usersafety@anthropic.com 以及應用程式內的點讚/倒讚反應。
  • 公司邀請廣大的 AI 社群使用 Petri 審計套件進行獨立的模型行為比較。

腳註: 1. 透過點讚/倒讚分享的對話會提供給 Anthropic,但不會用於訓練。 2. Prefilling 是僅限 API 的功能。 3. 自動化審計分數使用總對話數作為分母;這些分數最適合用於比較模型版本,而非絕對行為率。 4. Petri 的公開發布包含超過 100 個種子指令與可自定義的評分維度。

Sources

相關