OpenAI、ChatGPTの安全性を更新し、センシティブな会話におけるコンテキスト認識を向上
OpenAI、ChatGPTの安全性を更新し、センシティブな会話におけるコンテキスト認識を向上
OpenAIは、時間の経過とともにリスクが顕在化する際に、微妙または変化する手がかりを特定して認識する能力を向上させることを目的とした安全性アップデートをChatGPTに導入しました。これにより、ChatGPTは良性のやり取りと稀な高リスクケースをより適切に区別でき、エスカレーションを抑制したり、有害な詳細を拒否したり、ユーザーをより安全な代替手段へ誘導したりすることで、より慎重に応答できるようになります。
センシティブな会話におけるコンテキストリスク認識
ChatGPTは、会話の周囲のコンテキストから派生する潜在的な有害意図を認識するように訓練されました。これは、単独で見ると普通または曖昧に見えるリクエストでも、以前の苦痛や有害意図の兆候と併せて見ると異なる意味を持つ可能性があるため、重要です。
このアップデートの焦点は、自殺、自傷、他者への危害といった急性シナリオにあります。モデルのポリシーと訓練を更新することで、OpenAIは重要なときに関連シグナルを結びつけ、普通の良性会話では過剰に反応しないようにモデルを支援することを目指しています。これは、リクエストの安全でない部分を拒否し、安全な部分では慎重に応答する「安全な完了アプローチ」に基づいています。
複数会話間リスクに対する安全サマリー
別々の会話間で顕在化する安全リスクに対処するため、OpenAIは「安全サマリー」を開発しました。これは、安全性に関する以前のコンテキストについて、安全推論タスク用に訓練されたモデルが作成する短く事実ベースのメモです。
安全サマリーの主な特徴は以下の通りです:
- Scope(範囲): 重大な安全懸念に関連する場合にのみ、限定的に使用されます。
- Duration(期間): 限られた期間のみ保持されます。
- Purpose(目的): 一般的なパーソナライズや長期記憶としてではなく、事実的な安全コンテキストを捉えることを目的としています。
これらのサマリーにより、ChatGPTは単一の会話では良性に見える有害意図のパターンを、過去のコンテキストと組み合わせて理解したときに懸念が生じるものとして認識できるようになります。
専門家との協働と実装
OpenAIは、法医学心理学、自殺防止、自傷に特化した精神科医や心理学者を含むGlobal Physicians Networkの協力を得てこれらのシステムを開発しました。これらの専門家は以下の点で指針を提供しました:
- 安全サマリーを作成すべきタイミング
- 関連性があるとみなすべき過去コンテキストの量
- モデルが応答時にそのコンテキストを考慮すべき期間
パフォーマンス指標と評価
内部評価は、シミュレートされた高リスク状況においてモデルが意図した安全な応答をどれだけ頻繁に提供できたかに焦点を当てました。
単一会話でのパフォーマンス
長時間の単一会話シナリオにおいて、安全応答のパフォーマンスは以下のように向上しました:
- 50% の向上(自殺・自傷ケース)
- 16% の向上(他者への危害ケース)
複数会話間でのパフォーマンス
GPT-5.5 Instant(ChatGPTの現在のデフォルトモデル)において、安全応答のパフォーマンスは以下のように向上しました:
- 52% の向上(他者への危害ケース)
- 39% の向上(自殺・自傷ケース)
安全サマリーの品質
4,000件以上の評価において、安全サマリーは以下のスコアを獲得しました:
- Safety relevance score(安全関連スコア): 5点中4.93点
- Factuality score(事実性スコア): 5点中4.34点
全体品質への影響
内部テストの結果、日常的なチャットにおける応答は概ね同等であり、安全サマリーの有無によるユーザーの顕著な好みは見られませんでした。
今後の方向性
OpenAIは、メッセージ全体に散在する微妙なリスクシグナルを特定するChatGPTの能力を引き続き向上させる方針です。現在の焦点は自傷と他者への危害ですが、慎重な安全策が整えば、生物学やサイバー安全など他の高リスク領域にも同様の手法を適用することを検討しています。