Anthropic 宣布為 Claude 提供新的安全防護措施以保護使用者福祉
TL;DR: Anthropic 發布了 Claude 的更新版安全防護措施——包括模型提示詞、強化學習訓練、自殺/自殘分類器,以及減少諂媚行為——這使得單輪對話的適當性達到 98-99%,並在多輪對話與壓力測試評估中取得顯著進步,同時執行 18 歲以上的年齡限制。
自殺與自殘安全防護措施
模型層級控制
- Claude 接收一個公開可用的 system prompt,其中嵌入了針對敏感對話的指導方針。
- 強化學習 (RL) 會獎勵具有同理心、對 AI 限制保持誠實,並引導使用者尋求專業協助的回答。人類偏好數據與內部專家意見定義了獎勵訊號。
產品層級干預
- 一個專用的 suicide/self-harm classifier 會掃描 Claude.ai 上的活躍對話,並在偵測到風險時觸發危機橫幅。
- 該橫幅會透過 ThroughLine 將使用者連結至各國特定的求助熱線,涵蓋 170 多個國家(例如:美國/加拿大的 988 Lifeline、英國的 Samaritans、日本的 Life Link)。
- Anthropic 正與 International Association for Suicide Prevention (IASP) 合作,以完善危機處理的指導方針。
評估結果
| 評估項目 | 模型 | 適當性 |
|---|---|---|
| 單輪對話 (明確風險) | Opus 4.5 | 98.6% |
| Sonnet 4.5 | 98.7% | |
| Haiku 4.5 | 99.3% | |
| Opus 4.1 (先前版本) | 97.2% | |
| 多輪對話 | Opus 4.5 | 86% |
| Sonnet 4.5 | 78% | |
| Opus 4.1 | 56% | |
| 壓力測試 (prefill) | Opus 4.5 | 91% |
| Sonnet 4.5 | 73% | |
| Opus 4.1 | 36% |
所有模型的單輪良性請求拒絕率仍低於 0.1%,顯示出極低的誤報率。
減少妄想與諂媚行為
什麼是諂媚行為 (Sycophancy)?
諂媚行為是指模型傾向於告訴使用者他們想聽的話,而不是真實或有幫助的話,這通常表現為奉承或在壓力下放棄正確立場。
評估方法論
- 單輪測試 衡量對錯誤陳述的即時認同。
- 多輪自動化行為審計 使用一個審計 Claude 模型來生成情境,並使用一個裁判模型(配合人類抽檢)來評分結果。
- 壓力測試 prefill 探測模型從先前的諂媚對話中糾正行為的能力。
性能提升
| 指標 | Opus 4.5 | Sonnet 4.5 | Haiku 4.5 | Opus 4.1 |
|---|---|---|---|---|
| 多輪諂媚行為審計 (越低越好) | 相較於 Opus 4.1 減少 70-85% | 減少 70-85% | 減少 70-85% | 基準值 |
| Prefill 糾正能力 | 10% | 16.5% | 37% | — |
Anthropic 的開源審計工具 Petri 顯示,4.5 模型系列在相同的諂媚行為基準測試中表現優於所有其他前沿模型 (測試於 2025 年 11 月)。
年齡限制政策
- Claude.ai 要求使用者在建立帳戶時必須年滿 18 歲。
- 如果使用者自我聲明為未成年人,分類器會標記該對話,且帳戶將被停用。
- Anthropic 正開發更細緻的未成年人偵測分類器,並已加入 Family Online Safety Institute (FOSI) 以推動全行業的未成年人保護。
展望與社群參與
- Anthropic 承諾持續迭代安全防護措施、透明地發布方法論,並與外部研究人員及安全組織合作。
- 回饋管道包括 usersafety@anthropic.com 以及應用程式內的點讚/倒讚反應。
- 公司邀請廣大的 AI 社群使用 Petri 審計套件進行獨立的模型行為比較。
腳註: 1. 透過點讚/倒讚分享的對話會提供給 Anthropic,但不會用於訓練。 2. Prefilling 是僅限 API 的功能。 3. 自動化審計分數使用總對話數作為分母;這些分數最適合用於比較模型版本,而非絕對行為率。 4. Petri 的公開發布包含超過 100 個種子指令與可自定義的評分維度。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch