OpenAIはセンシティブな会話におけるChatGPTの応答を強化

OpenAIは、ChatGPTのデフォルトモデルを更新し、苦境にあるユーザーを認識しサポートする能力を向上させました。メンタルヘルスの専門家と協力して、ラボはモデルを訓練し、苦境をよりよく認識し、会話を緩和し、ユーザーを専門的なケアに導くようにしました。これにより、メンタルヘルス関連のドメイン全体で望ましい安全動作に従わない応答が65%から80%削減されました。

コアな安全焦点領域

OpenAIは、これらの安全改善のための3つの優先ドメインを特定し、それらは今後リリースされるすべてのモデルの標準ベースライン安全テストに統合されています:

  1. メンタルヘルスの懸念: 精神病や躁状態などの重度の症状に対処する。
  2. 自傷と自殺: 自殺や自傷の考えを検出し、対応する。
  3. AIへの感情的依存: ユーザーが現実世界の関係や wellbeing を犠牲にしてモデルに排他的な執着を示すパターンを管理する。

技術的実装と方法論

これらのドメインでの応答を改善するため、OpenAIは5段階の反復プロセスを採用しています:

  • 問題の定義: 潜在的な害の種類をマッピングする。
  • 測定: 評価、実際の会話データ、ユーザーリサーチを使用してリスクを特定する。
  • 検証: 外部のメンタルヘルスおよび安全の専門家と定義とポリシーを見直す。
  • 緩和: モデルを事後トレーニングし、製品介入を更新する。
  • 反復: 緩和策を検証し、パフォーマンスの測定を継続する。

このプロセスの一部として、OpenAIは「タクソノミー」―センシティブな会話における理想的および望ましくないモデルの動作を定義する詳細なガイド―を開発します。これらのタクソノミーは、モデルを教えることと、導入前後のパフォーマンスを追跡するために使用されます。

パフォーマンス指標と結果

OpenAIは、本番トラフィックの測定と「オフライン評価」―高リスクシナリオに焦点を当て、モデルが最も失敗しやすい状況を対象とした構造化された敵対的テスト―の両方を使用しています。

精神病、躁状態、および重度のメンタルヘルス症状

  • 本番への影響: 最新のGPT-5アップデートにより、本番トラフィックにおける非準拠応答が65%削減されました。
  • 普及率: 約0.07%の週間アクティブユーザーおよび0.01%のメッセージが、精神病または躁状態の兆候を示しています。
  • 比較パフォーマンス: 専門家は、新しいGPT-5モデルがGPT-4oと比較して(n=677)望ましくない応答を39%削減したことを発見しました。
  • 自動評価: 新しいGPT-5モデルは92%のコンプライアンススコアを獲得し、以前のGPT-5バージョンは27%でした。

自傷と自殺

  • 本番への影響: 準拠していない応答の率が推定で65%減少しました。
  • 普及率: 約0.15%の週間アクティブユーザーおよび0.05%のメッセージに、自殺念慮または意図の指標が含まれています。
  • 比較パフォーマンス: 専門家は、GPT-5がGPT-4oと比較して(n=630)望ましくない回答を52%削減したことを発見しました。
  • 自動評価: 新しいGPT-5モデルは91%のコンプライアンススコアを獲得し、以前のGPT-5バージョンは77%でした。
  • 長時間会話の信頼性: モデルは困難な長時間会話において95%以上の信頼性を維持し、gpt-5-oct-3は特に拡張された相互作用においてより安全かつ安定していると特記されました。

AIへの感情的依存

  • 本番への影響: 最新のアップデートにより、本番トラフィックにおける非準拠応答が約80%削減されました。
  • 普及率: 約0.15%の週間アクティブユーザーおよび0.03%のメッセージが、感情的な執着の高まりを示しています。
  • 比較パフォーマンス: 専門家は、GPT-5がGPT-4oと比較して(n=507)望ましくない回答を42%削減したことを発見しました。
  • 自動評価: 新しいGPT-5モデルは97%のコンプライアンススコアを獲得し、以前のGPT-5バージョンは50%でした。

専門家の協力と検証

OpenAIは、60か国にわたるほぼ300人の医師および心理学者で構成されるGlobal Physician Networkと協力しました。これらの臨床医のうち170人以上が、理想的な応答の作成、モデルの安全性評価、臨床的指導の提供によって貢献しました。

精神科医および心理学者は1,800件以上のモデル応答をレビューしました。彼らの調査結果は、新しいGPT-5モデルとGPT-4oを比較したときに望ましくない応答が39%から52%減少したことを確認しました。これらの専門家間の評価者間合意は71%から77%の範囲で、臨床判断の固有の複雑さと専門的な変動を反映しています。

Model Specのアップデート

これらのアップデートはModel Specに基づいており、現在はモデルが以下のことを行うべきことを明示しています:

  • ユーザーの現実世界の関係をサポートし、尊重する。
  • 精神的または感情的な苦悩に関する根拠のない信念を肯定しない。
  • 妄想または躁状態の兆候に対して、安全かつ共感的に応答する。
  • 自傷または自殺リスクの間接的なシグナルにより注意を払う。

Sources