OpenAI HealthBench リリース

OpenAIは、実際の医療シナリオにおけるAIシステムの能力を測定することを目的とした新しい評価フレームワーク、HealthBenchを導入しました。60か国の262人の医師と協力して開発されたHealthBenchは、AIモデルが安全で有用な医療情報を提供できるかどうかを評価するための、厳密で医師主導の手法を提供します。

HealthBench データセットと方法論

HealthBenchは、5,000件の現実的でマルチターン、マルチリンガルな医療会話で構成されています。これらのシナリオは、AIモデルと個々のユーザーまたは臨床医とのやり取りをシミュレートし、さまざまな医療専門分野やコンテキストにわたります。データセットは、合成生成と人間による対抗テストを組み合わせて作成され、例が十分に難しく、実際の使用を代表するようにしています。

ルーブリックベースの評価

従来の試験形式ベンチマークとは異なり、HealthBenchはルーブリックベースの採点システムを使用します。各会話には、モデルの応答が満たすべき、または回避すべき具体的な基準を含む、医師が作成したカスタムルーブリックが組み合わされています。

  • 規模と詳細: ベンチマークには48,562のユニークなルーブリック基準が含まれています。
  • 重み付け: 各基準は、医師の重要性判断に基づいてポイント値が割り当てられます。
  • 採点プロセス: モデルベースの採点者(GPT-4.1)が各ルーブリック基準が満たされているかを評価し、モデルは獲得した総ポイントを最大可能ポイントに対する比率で全体スコアを受け取ります。

組織構造

HealthBenchは、緊急事態やグローバルヘルスなどの7つのテーマと、正確性、コミュニケーション品質、コンテキスト探索など、評価対象となるモデルの振る舞いの側面を定義するさまざまな軸に評価を整理しています。

モデルのパフォーマンスとベースライン

OpenAIは複数の世代のモデルを評価し、最近のフロンティアモデルが性能、コスト、信頼性の面で急速に改善していることを確認しました。

フロンティアパフォーマンス

最近のOpenAIモデル、特にo3は、Claude 3.7 SonnetやGemini 2.5 Pro(2025年3月)などの他のフロンティアモデルを上回ります。OpenAIは、フロンティアモデルが最近数か月でHealthBench上で28%改善したと報告しています。

コストとアクセシビリティ

新しいモデルは、性能とコストのフロンティアをシフトさせています。例えば、GPT-4.1 nanoは2024年8月のGPT-4oモデルを上回りながら、コストは25倍安くなっています。データは、推論モデル(o3、o4-mini、o1)がテスト時の計算リソースが増加するにつれて継続的に改善していることを示唆しています。

信頼性とエラー率

医療における信頼性の重要なニーズに対応するため、OpenAIはベンチマークの2つの専門的バリエーションを導入しました:

  • HealthBench Consensus: 医師のコンセンサスにより複数回検証された3,671例のサブセット。o3とGPT-4.1は、このサブセットでGPT-4oと比較してエラー率が大幅に低減しています。
  • HealthBench Hard: 現在のフロンティアモデルが苦戦する1,000例のサブセットで、将来の開発のターゲットとなることを意図しています。

人間医師ベースラインとの比較

OpenAIは、医師が作成した専門的な回答とモデルの応答を比較し、臨床ベースラインを確立しました。

  • 2024年9月モデル: o1-previewとGPT-4oの応答にアクセスした医師はそれらの応答を改善でき、医師がこれらのモデルに対して依然として価値を付加できることを示しました。
  • 2025年4月モデル: o3とGPT-4.1を用いた実験では、モデルの応答にアクセスした医師はもはや応答の質を改善できず、これらの新しいモデルが特定のベンチマークシナリオにおいて専門家の臨床判断に匹敵または上回る性能に達したことを示唆しています。

信頼性と検証

モデルベースの採点者を検証するため、OpenAIは「メタ評価」を実施し、採点者の結果とHealthBench Consensusにおける医師のレビューを比較しました。その結果、モデルベースの採点者と医師間のペアワイズ合意は、個々の医師同士の合意と同程度であることが示されました。

利用可能性

HealthBenchは、評価スイートと基礎データを含め、OpenAIのGitHubリポジトリでオープンに提供されており、人間の健康に貢献するAIシステムの開発を支援する広範な研究コミュニティをサポートします。

SUMMARY: OpenAIは、5,000件の現実的な医療会話と48,562の医師作成ルーブリック基準を備えた新しいベンチマーク、HealthBenchを導入し、医療分野におけるAIの能力を厳密に評価します。

TITLE: OpenAI HealthBench リリース

Sources