ChatGPTにおける健康インテリジェンスの向上

ChatGPTにおける健康インテリジェンスの向上

GPT-5.5 Instant が健康インテリジェンスを即座に向上

OpenAIはGPT-5.5 Instantを導入し、ChatGPTが健康・ウェルネスに関する問い合わせに対応する能力を大幅に向上させました。このモデルは、緊急ケアの必要性の認識、関連するユーザーコンテキストの要求、不確実性の説明、複雑な健康情報の簡素化において大きな進歩を示しています。

GPT-5.5 InstantはChatGPTのすべての無料ユーザーが利用でき、これらの健康関連機能へのアクセスが拡大しました。最も難しい健康評価において、そのパフォーマンスは現在、OpenAIの最先端Thinkingモデルに匹敵します。

健康パフォーマンスと正確性の測定

OpenAIは健康に特化した評価を用いて、回答が正確で理解しやすく、適切な判断に基づいていることを保証しています。進捗は以下のフレームワークで測定されます:

評価フレームワーク

  • HealthBench と HealthBench Professional: これらの評価は、実際的な健康会話と医師が作成したルーブリックを利用し、正確性、安全性、コミュニケーション、コンテキスト認識、完全性、適切なエスカレーションを評価します。
  • 医師主導の比較: 医師パネルがGPT-5.5 Instantの3,500件の回答を、医師が(時間とインターネットアクセスは無制限だがAIは使用せず)作成した回答および旧モデルと比較しました。GPT-5.5 Instantは正確性、コミュニケーション、完全性、指示遵守、健康判断の有用性など、すべての基準で高く評価されました。

本番トラフィックのモニタリング

実際のパフォーマンスを追跡するため、OpenAIは本番トラフィック上でプライバシー保護型モニタを使用しています。週あたり数十億件のメッセージを分析した結果、少なくとも1つの事実性フラグが付いた回答の割合は過去2か月で71%減少しました。

医師主導のモデル改善

GPT-5.5 Instantの改善は、60か国、49言語、26の医療専門分野にわたる260人以上の医師からなるグローバルネットワークによって推進されています。このネットワークは、実世界の健康シナリオで「良い」回答を定義するために必要な医療専門知識を提供します。

医師フィードバックの役割

  • 回答レビュー: 医師は患者や臨床医による実際の使用を反映した70万件以上のモデル回答例をレビューしました。
  • ルーブリック開発: 医師のフィードバックは、回答が正確、安全、明確、完全、そして適切に慎重であるかを測定するルーブリックと評価基準の作成に使用されます。
  • 失敗モードの特定: GPT-5.5 Instantは、従来のモデルや人間の医師に比べて失敗モードが少なく、特にローカル医療コンテキストへの対応、レッドフラッグの特定、ユーザーからの追加コンテキスト要求などの領域で優れています。

より広範な医療ツールとの統合

これらの一般的な健康インテリジェンスの進歩は、ChatGPT for Clinicians や OpenAI for Healthcare といった、医療専門家が文書作成、研究、ケア提供を支援するための専門ツールを含む、OpenAIの幅広い医療イニシアチブを支えています。

Sources