OpenAI は計算生物学の推論のために GeneBench-Pro を発表
OpenAI は計算生物学の推論のために GeneBench-Pro を発表
OpenAI は、実際の計算生物学に必要な判断が重く、反復的な分析を扱えるかどうかをテストするベンチマークである GeneBench-Pro を発表しました。事実の再記憶や定義済みワークフローをテストする従来のベンチマークとは異なり、GeneBench-Pro は「研究の嗜好」―あいまいさに対処し、仮定を見直し、意思決定に備えた結果に到達するための正しい分析経路を選ぶ能力―を測定します。
「研究の嗜好」と科学的判断の測定
GeneBench-Pro は、科学的研究における AI のパフォーマンスを制約するシステムレベルの判断呼び出しに焦点を当てています。このベンチマークは、「研究の嗜好」を、分析を形作る判断呼び出しの連鎖として定義しています。これには、データがサポートできる質問を決定し、早期診断に基づいて初期計画を見直すタイミングを知ることが含まれます。
これらの能力をテストするために、各問題はモデルに以下を提供します:
- 現実的で雑然としたデータセット。
- 簡潔な実験コンテキスト。
- 下流の意思決定に結びついた目標推定量。
モデルはデータを探索し、適切な分析アプローチを選択し、最終的な答えを提供するために実験の反復プロセスに従わなければなりません。
データセットの構築とドメインカバレッジ
GeneBench-Pro は、ゲノミクス、定量生物学、翻訳医学にわたる 10 のドメインと 21 のサブドメインにわたる 129 の質問から構成されています。任意の著者の好みや数値の感度の欠如などの一般的なベンチマークの失敗を避けるため、OpenAI は合成データ生成を利用しました。
データ生成プロセスをシミュレートし、完全な因果構造を知ることで、OpenAI は次のことを確保しました:
- 主観的な分析選択の合理的な違いは依然として受け入れられる数値結果を生み出します。
- 妥当だが間違った分析は失敗します。
- 詳細なトレース分析を通じて、情報漏洩と意図しない解決経路が最小限に抑えられます。
さらに、129 の質問のうち 82 は、外部のドメインエキスパート(教授、業界の科学者、ポスドク研究者など)によって監査され、現実性、目標回答の識別可能性、および手法の適切性が確認されました。
評価フレームワークと採点
エージェントは、Python、科学計算ライブラリ、および PLINK 2.0 などの基本的なゲノミクスパッケージを含む標準のバイオインフォマティクススタックを備えた隔離されたワークスペースで評価されます。
データが合成生成されているため、正しさは既知のターゲットに対して決定論的に採点されます。これにより、ルーブリックベースの評価にしばしば関連する変動と冗長性の影響が取り除かれます。
OpenAI は、Hugging Face 上で 10 の代表的な質問をオープンソースとして公開し、独立した第三者によるベンチマークのために Artificial Analysis に 50 質問のサブセットを提供します。
パフォーマンス結果とモデル比較
GPT-5.6 Sol は、ベンチマークにおいて最も高いパフォーマンスを示すモデルで、Pro モードを有効にしたときに合格率 31.5%(最高の推論レベルでは 28.7%)を達成しました。これは、元の GeneBench で最良のフロンティアモデルである GPT-5 が 5%未満だったことと比較して、大きな向上を示しています。
結果から得られた主な発見は以下の通りです:
- テストタイムコンピューティングのスケーリング: 最高の推論レベルでは、GPT-5.6 Sol は GPT-5.2 と比べてほぼ 6 倍多くの質問を解決し、使用するトークンは約 2/3 です。
- モデルファミリーのギャップ: GPT モデルは、GLM 5.2 などの主要なオープンソースモデルを上回りました。OpenAI は、ハイレベルな科学的推論におけるパフォーマンスギャップが、コーディングベンチマークで見られるギャップよりもはるかに大きいことを指摘しており、これはオープンソースモデルが一般的な推論よりもコーディングに特化している可能性を示唆しています。
- 人間の労働との比較: レビューアーは、典型的な GeneBench-Pro の問題が人間のエキスパートによって完了するのに 20~40 時間かかると推定しています。AI エージェントは現在のところ専門家を置き換えるほど信頼性が低いですが、推論コスト(数ドル)は、推定される人間の労働コスト(数千ドル)よりも桁違いに低いです。
科学的発見への示唆
フロンティアモデルはまだ問題の3分の1未満しか解決していませんが、困難なタスクに対する部分的な進歩を遂げる能力を示しています。OpenAI は、現在の失敗パターン―観察を行うがそれを広い文脈に統合することに苦労する―が、人間の初心者とエキスパートの違いを反映していると示唆しています。
AI エージェントがこれらの分析を信頼性高く自動化できる場合、仮説のトリアージ、ターゲットの優先順位付け、およびデータ生成と意思決定の間の反復サイクルを加速することで産業研究を変革し得ます。これにより、科学的発見のボトルネックがデータ生成から実行可能な洞察の抽出へと移り変わります。
Sources
- OriginalIntroducing GeneBench-Pro