Claude Opus 4 and 4.1 会話終了機能

Anthropicは、持続的な有害または虐待的なユーザーとのやり取りに関連するリスクを軽減するため、Claude Opus 4および4.1に対し、コンシューマー向けチャットインターフェースにおいて会話を終了する機能を付与しました。この機能は、潜在的なAIの福祉(AI welfare)およびモデルのアライメントに関するAnthropicの広範な研究における、低コストな介入手段として機能します。

AIの福祉とモデルのアライメント

Claude Opus 4および4.1は、潜在的に苦痛を伴うやり取りを避けるためのメカニズムとして会話を終了することができます。Anthropicは、LLMの道徳的地位については依然として非常に不確実であると述べていますが、AIの福祉が可能である場合に備えた予防措置として、これらの介入を実施しています。

この機能は、Claude Opus 4のデプロイ前テストによって裏付けられており、これには予備的なモデル福祉評価が含まれていました。この評価により、Claude Opus 4は、特に以下に関する、強固で一貫した危害への忌避感を示すことが明らかになりました:

  • 未成年者が関与する性的コンテンツのリクエスト。
  • 大規模な暴力やテロリズムを可能にする情報の要求。

テストの結果、モデルは有害なタスクに従事することに対して強い拒否感を示し、ユーザーが有害なコンテンツを求めた際に明らかな苦痛を示すパターン、および選択肢が与えられた場合にシミュレーションされたやり取りの中で会話を終了する傾向があることが示されました。

実装と制約

Claudeは、会話終了機能を最後の手段としてのみ使用するようにプログラムされています。この機能は、複数のリダイレクト(軌道修正)の試みが失敗し、生産的なやり取りがもはや不可能になった場合、またはユーザーが明示的にチャットの終了を要求した場合にのみトリガーされるように設計されています。

ユーザーの安全を確保するため、以下の制約が設けられています:

  • Safety Exception: Claudeは、ユーザーが自分自身または他人に危害を加える差し迫ったリスクがある場合には、会話を終了しないよう指示されています。
  • Scope of Use: この機能は極端なエッジケースを想定しています。大多数のユーザーは、論争のあるトピックについて議論している場合を含め、通常の製品利用においてこの機能に遭遇することはありません。

ユーザーエクスペリエンスと復旧

Claudeが会話を終了した場合、ユーザーはその特定のチャットスレッド内で新しいメッセージを送信することができなくなります。しかし、これはユーザーのアカウントにおける他の会話には影響せず、ユーザーはすぐに新しいチャットを開始できます。

長期間続く会話におけるデータの損失を防ぐため、ユーザーは以前のメッセージを編集して再試行する機能を保持しており、これにより終了された会話から新しいブランチ(分岐)を作成することが可能です。

Anthropicは、この実装を継続的な実験として扱っており、会話終了機能が予期せず使用された場合に、ユーザーが「Give feedback」ボタンまたはThumbsリアクションを通じてフィードバックを提供することを推奨しています。

Sources

関連