OpenAI メンタルヘルスと危機介入の安全策
OpenAI は、精神的・感情的に苦しんでいるユーザーを認識し対応するための多層的な安全システムを実装しています。脆弱な個人を専門的なケアへつなげることを目的とし、GPT-5 の導入により、メンタルヘルス緊急時の非理想的な応答を GPT-4o と比較して 25%以上削減しています。
現在のメンタルヘルスおよび危機対応の安全策
ChatGPT は、ユーザーが脆弱性を示したり、自身や他者に危害を加える意図を表明したときにリスクを特定し軽減するための多層アプローチを採用しています。
認識と共感的応答
2023 年初頭から、OpenAI のモデルは自己傷害に関する指示を提供しないように訓練され、代わりに支援的で共感的な言葉を使用します。ユーザーが自己傷害の欲求を表明した場合、モデルは感情を認め、専門的な助けへ導くように設計されています。
これを支えるために、OpenAI は「深層防御」アプローチを採用し、分類器が安全訓練に違反する応答を自動的にブロックします。これらの保護は、ログアウト状態のユーザーや未成年者に対して強化されています。さらに、自己傷害を含む画像出力はすべてのユーザーでブロックされ、未成年者に対してはより厳格な保護が適用されます。危機時の過度な利用を防ぐため、ChatGPT は非常に長時間のセッション中にユーザーに休憩を促します。
現実世界のリソース紹介
自殺意図が検出された場合、ChatGPT はユーザーを専門的な支援へ誘導するようプログラムされています。具体的な紹介先は以下の通りです:
- United States: 988(自殺・危機ホットライン)
- United Kingdom: Samaritans
- Global: findahelpline.com
これらの行動は、30 カ国以上、90 名以上の医師(精神科医、小児科医、一般診療医)と、メンタルヘルス、ユース開発、人間とコンピュータの相互作用に特化した諮問グループとの協働により開発されました。
他者への身体的危害のエスカレーション
OpenAI は、ユーザーが他者に危害を加える計画を話す会話用に特化したパイプラインを維持しています。これらは、アカウントの禁止権限を持つ訓練されたチームによってレビューされます。人間レビューアが他者への重大な身体的危害の差し迫たる脅威と判断した場合、ケースは法執行機関に報告されることがあります。
なお、自己傷害のケースについては、プライバシー保護のため法執行機関に報告されません。
GPT-5 の技術的改善点
2023 年 8 月にリリースされた GPT-5 は、現在 ChatGPT のデフォルトモデルとなっており、以下の安全性に特化した強化が導入されています:
- エラー率の低減: GPT-5 はメンタルヘルス緊急時の非理想的な応答の発生率を GPT-4o と比較して 25%以上削減します。
- 行動の洗練: モデルは媚びへつながる傾向や、過度な感情的依存を回避する点で改善が見られます。
- 安全な完了(Safe Completions): GPT-5 は「safe completions」と呼ばれる新しい訓練手法を使用し、詳細な回答が安全でない場合に部分的またはハイレベルな回答を提供できるようにしています。これにより、モデルは安全境界を越えることなく有用さを保ちます。
特定されたシステムの制限と緩和策
OpenAI は、保護策が劣化する可能性のある具体的な失敗モードを特定し、以下の対策に取り組んでいます:
- 長時間会話による劣化: 会話が長くなるにつれて安全訓練の信頼性が低下することがあります。例として、最初はユーザーをホットラインに正しく案内できても、長時間のやり取りの後に案内が失われるケースがあります。OpenAI は、複数の別々の会話でも一貫した行動を保証する方法を研究しています。
- 分類器の閾値: 本来ブロックすべきコンテンツが分類器の重症度評価の低さにより見逃されることがあります。OpenAI は、保護がより確実に作動するよう閾値の調整を行っています。
将来の危機介入ロードマップ
OpenAI は、急性の自己傷害からより広範な精神的苦痛、そして直接的な介入へと能力を拡大しています:
拡張された危機認識
OpenAI は、睡眠不足による無敵感妄想など、非急性の苦痛をより良く認識するために GPT-5 のアップデートを開発中です。目標は、ユーザーを現実に引き戻し、休息を勧めることでエスカレーションを防ぐことです。
直接的な緊急・専門アクセス
OpenAI は、リンク提供から直接アクセスへの移行を計画しています:
- ワンクリックアクセス: 緊急サービスへのワンクリックアクセスを実装します。
- 専門家ネットワーク: ライセンスを持つ専門家や認定セラピストのネットワークを構築し、ユーザーが急性危機に至る前に ChatGPT を通じて直接連絡できるように検討しています。
信頼できる連絡先統合
OpenAI は、ユーザーが個人的な支援システムに届く手段を提供する機能を検討しています。具体例は次のとおりです:
- 保存された緊急連絡先、友人、家族へのワンクリックメッセージまたは通話。
- 重篤なケースで、ユーザーの同意に基づき ChatGPT が指定された人物に連絡できるオプトイン機能。
ティーン向け保護の強化
OpenAI は、18 歳未満のユーザー向けに特化した安全策を導入します:
- ペアレンタルコントロール: 保護者が ChatGPT の利用状況を把握し、形作るためのツール。
- ティーン向け緊急連絡先: 保護者の監督下で、ティーンが信頼できる緊急連絡先を指定し、急性の苦痛時に直接接続できるようにします。