OpenAI FrontierScience ベンチマーク リリース

OpenAIは、AIモデルのエキスパートレベルの科学的能力を評価するために設計された新しいベンチマークであるFrontierScienceをリリースしました。このベンチマークは、既存の科学ベンチマークの飽和状態に対処するため、構造化された科学的推論とオープンエンドの研究能力の両方を測定するオリジナルで難易度の高いタスクを提供します。

FrontierScience ベンチマーク構造

FrontierScienceは、物理、化学、生物学の分野にわたる700以上のテキストベースの質問から構成され、主要評価に使用される「ゴールドセット」として160の質問があります。ベンチマークは、異なる種類の科学的知能を測定するために2つの異なるトラックに分かれています:

FrontierScience-Olympiad

このトラックには、国際オリンピックメダリストおよびナショナルチームコーチ(合計109個のメダルを表す)によって設計された100の質問が含まれます。制約された短回答形式を通じて科学的推論を評価します。これらの理論的な質問は、国際オリンピック競技で見られるものと少なくとも同等の難易度になるように設計されています。

FrontierScience-Research

このトラックは、博士レベルの科学者(博士課程の学生、教授、ポスドク研究者を含む)によって設計された60のオリジナルな研究サブタスクから構成されます。これらのタスクは自己完結型のマルチステップ問題であり、アクティブな研究中に博士レベルの科学者が直面する難しさを反映しています。このトラックのパフォーマンスは、最終答案と中間推論ステップの両方を評価する10点ルーブリックを使用して採点されます。

モデルのパフォーマンスと結果

初期評価では、GPT-5.2が両トラックで最高性能のモデルとして浮上しましたが、結果は構造化された推論とオープンエンドの研究の間に大きなギャップがあることを示しています:

  • FrontierScience-Olympiad: GPT-5.2は77%を獲得し、Gemini 3 Proがそれに続き76%でした。
  • FrontierScience-Research: GPT-5.2は25%を獲得しました。

評価には、Claude Opus 4.5、Gemini 3 Pro、GPT-4o、OpenAI o4-mini、OpenAI o3などの他のフロンティアモデルも含まれました。データは、推論にかける時間(思考時間)が長いほど精度が向上することを示しています。

これらの改善にもかかわらず、OpenAIはフロンティアモデルが依然として推論、論理、計算ミス、事実の不正確さ、およびニッチな科学概念の理解不足に苦しんでいることを指摘しています。

採点方法論

スケーラビリティと正確性を確保するために、OpenAIは2つのトラックに対して異なる採点メカニズムを採用しています:

  • Short Answer Verification: オリンピアドセットでは、数値、表現、またはファジー文字列マッチを使用して正確性を検証します。
  • Rubric-Based Grading: リサーチセットでは、モデルベースの採点者(GPT-5)が10点ルーブリックに基づいて回答を評価します。7/10点以上を獲得した解答は「正解」とみなされます。このルーブリックベースのアプローチにより、最終出力だけでなく中間推論ステップの分析も可能になります。

科学研究へのインプリケーション

FrontierScienceは標準化された測定ツールですが、OpenAIはGPT-5などのモデルが実際の科学ワークフローをすでに加速していると報告しています。論文Early science acceleration experiments with GPT-5(2025年11月)によると、これらのシステムは横断的文献検索や複雑な数学的証明に使用されており、以前は週間かかっていた作業を時間単位に短縮することがよくあります。

OpenAIはFrontierScienceをエキスパートレベルの推論のための「北極星」として位置付けていますが、ベンチマークの限界を認めています。現在のところ、真に新しい仮説を生成する能力や、物理的実験システムおよびマルチモーダルデータ(ビデオなど)と相互作用する能力を測定していません。

Sources