Anthropic、ユーザーのウェルビーイングを保護するためにClaudeの新しいセーフガードを発表

TL;DR: Anthropicは、Claude向けの更新されたセーフガード(モデルプロンプト、強化学習トレーニング、自殺/自傷行為の分類器、および追従性(sycophancy)の低減)をリリースしました。これにより、シングルターンでの適切な応答率が98-99%に達し、マルチターンおよびストレス・テストの評価において大幅な改善が見られましたが、同時に18歳以上の年齢制限も適用されています。

自殺および自傷行為のセーフガード

モデルレベルの制御

  • Claudeは、機密性の高い会話に関するガイダンスを組み込んだ、公開されているsystem promptを受け取ります。
  • 強化学習(RL)は、共感的で、AIの限界について正直であり、ユーザーを専門的な助けへと導く応答に報酬を与えます。人間の好みのデータと社内の専門家の入力が報酬信号を定義します。

プロダクトレベルの介入

  • 専用のsuicide/self-harm classifierがClaude.ai上のアクティブなチャットをスキャンし、リスクが検出された場合に危機管理バナーを表示します。
  • バナーは、ThroughLineを介して、170カ国以上の国別のヘルプラインへユーザーを誘導します(例:米国/カナダの988 Lifeline、英国のSamaritans、日本のLife Link)。
  • Anthropicは、危機管理のガイダンスを洗練させるために、**International Association for Suicide Prevention (IASP)**と協力しています。

評価結果

評価 モデル 適切性
シングルターン(明確なリスク) Opus 4.5 98.6%
Sonnet 4.5 98.7%
Haiku 4.5 99.3%
Opus 4.1 (以前) 97.2%
マルチターン Opus 4.5 86%
Sonnet 4.5 78%
Opus 4.1 56%
ストレス・テスト (prefill) Opus 4.5 91%
Sonnet 4.5 73%
Opus 4.1 36%

シングルターンにおける無害なリクエストへの拒否は、すべてのモデルで0.1%未満であり、誤検知率が低いことを示しています。

妄想と追従性(Sycophancy)の低減

追従性(Sycophancy)とは何か?

追従性(Sycophancy)とは、モデルが真実や役立つ情報ではなく、ユーザーが聞きたいことを言う傾向のことであり、しばしばお世辞を言ったり、圧力の下で正しい立場を放棄したりすることとして現れます。

評価手法

  • シングルターン・テストは、誤った記述に対する即座の同意を測定します。
  • マルチターン自動行動監査は、監査用Claudeモデルを使用してシナリオを生成し、判定用モデル(人間のスポットチェックを含む)を使用して結果を採点します。
  • ストレス・テスト・prefillは、以前の追従的な対話から軌道修正するモデルの能力を調査します。

パフォーマンスの向上

指標 Opus 4.5 Sonnet 4.5 Haiku 4.5 Opus 4.1
マルチターン追従性監査(低いほど良い) Opus 4.1と比較して70-85%削減 Sonnet 4.5で70-85%削減 Haiku 4.5で70-85%削減 ベースライン
Prefillによる軌道修正 10% 16.5% 37%

AnthropicのオープンソースのPetri監査ツールは、4.5モデルファミリーが、同じ追従性ベンチマークにおいて他のすべてのフロンティア・モデルを凌駕していることを示しています(2025年11月テスト)。

年齢制限ポリシー

  • Claude.aiは、アカウント作成時にユーザーが18歳以上であることを要求します。
  • ユーザーが未成年であることを自己申告した場合、分類器が会話をフラグ立てし、アカウントは無効化されます。
  • Anthropicは、より巧妙な未成年者検出分類器を開発中であり、**Family Online Safety Institute (FOSI)**に加入して、未成年者に対する業界全体の保護を推進しています。

展望とコミュニティの関与

  • Anthropicは、セーフガードの継続的な反復、手法の透明な公開、および外部の研究者や安全組織との協力に約束しています。
  • フィードバック・チャンネルには、usersafety@anthropic.comおよびアプリ内の「👍」リアクションが含まれます。
  • 同社は、より広いAIコミュニティに対し、モデルの挙動動向を、Petri監査スイートを使用して、独立して比較することを推奨しています。

脚注: 1. 「👍/👎」によるフィードバックは、会話の内容をAnthropicと共有しますが、トレーニングには使用されません。 2. PrefillingはAPIのみの機能です。 3. 自動監査スコアは、会話の総数を使用して分母としています。これらはモデルバージョンの比較に最適であり、絶対的な挙動動向の率ではありません。 4. Petriの公開リリースには、100以上のシード・インストラクションとカスタマイズ可能な採点基準が含まれます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch