BioMysteryBenchによるClaudeのバイオインフォマティクス研究能力の評価
Anthropicは、AIモデルが実世界のデータセットを使用して複雑でオープンエンドな研究問題を解決できるかどうかを評価するために設計された、新しいバイオインフォマティクス・ベンチマークであるBioMysteryBenchを開発しました。評価の結果、Claudeの科学的能力は世代を追うごとに急速に向上しており、最新モデルは人間の専門家と同等の性能を発揮し、人間の専門家パネルが解決できなかったいくつかの問題を解決していることが明らかになりました。
バイオインフォマティクス研究を評価する際の課題
科学的なAIを評価することは困難です。なぜなら、従来のベンチマークは、実際の研究が持つ、整理されていないオープンエンドな性質を捉えきれないことが多いからです。Anthropicは、標準的な科学ベンチマークを作成する上での3つの主な障害を特定しています。
- 手法の多様性: バイオロジーにおいて、研究者の背景や利用可能なリソースに基づいて、問題へのアプローチ方法には、しばしば複数の「正しい」方法が存在します。
- 主観性とノイズ: 生物学的データセットはしばしばノイズを含んでおり、これは、主観的な研究上の決定におけるわずかな違いが、全く異なる結論を導き出す可能性があることを意味します。
- 人間の知識のギャップ: 最も影響力のある研究タスクは、人間がまだ解決していないものであるため、人間のパフォーマンスを唯一の正解(ground truth)として使用することは不可能です。
BioMysteryBench: 科学のための検証可能なフレームワーク
BioMysteryBenchは、さまざまなバイオインフォマティクスの分野におけるドメインエキスパートによって作成された99の質問で構成されています。上述の評価の課題を克服するために、このベンチマークは4つの主要な特性を備えています。
- 手法に依存しない採点: Claudeは、特定の分析経路を辿るのではなく、最終的な回答に基づいて採点されるため、研究における創造性が許容されます。
- 客観的な正解(Ground Truth): 回答は、主観的な科学的結論ではなく、データの制御可能な特性や検証済みのメタデータ(例:PCR assays)から導き出されます。
- 超人的な問題生成: 回答がデータの特性に基づいているため、このベンチマークには、客観的に解決可能であるが、人間の専門家には解決が困難すぎた問題が含まれています。
- ツール利用可能な環境: Claudeは、標準的なバイオインフォマティクス・ツールを備えたコンテナ内に配置され、pipやcondaを通じて新しいツールをインストールする能力、およびNCBIやEnsemblなどのデータベースへのアクセス権を持っています。
質問は、主にDNAおよびRNAシーケンシングデータ(WGS, scRNA-seq, methylation, ChIP-seq, metagenomics, Hi-C)に加えて、プロテオミクスおよびメタボロミクスに焦点を当てています。
パフォーマンス比較: AI vs. 人間の専門家
Anthropicは、各質問に対して最大5名のドメインエキスパートに回答を依頼することで、ベンチマークのベースラインを設定しました。これにより、タスクは2つのカテゴリーに分けられました。
人間が解決可能なタスク
少なくとも1人の人間が解決できた76のタスクにおいて、Claudeは強力なパフォーマンスを示し、しばしば人間の戦略を反映していました。いくつかのケースでは、Claudeは、TATAボックスの発見と同様に、パターンやシーケンスを認識するための「直感」を使用しており、これは従来のアルゴリズム的なアプローチとは異なります。
人間が困難なタスク
専門家が解決できなかった残りの23の質問のうち、Claude Sonnet 4.6およびより高度なモデルは、かなりの割合を解決しました。Claude Mythos Previewは、これらの人間にとって困難な問題に対して30%の解決率を達成しました。
Claudeの研究戦略の分析
Opus 4.6のトランスクリプトを分析した結果、Claudeが困難なタスクにおいて人間を凌駕する2つの主要な戦略が明らかになりました。
- 「何でも知っている」アプローチ: Claudeは、構造生物学、分子プロファイル、および数十万もの論文からのメタ解析に関する膨大な内部知識を活用して、人間が複数のデータベースをマニュアルで繋ぎ合わせる必要がある問題を解決します。
- エビデンスの階層化: 不確実な場合、Claudeは複数の異なる手法を重ね合わせ、複数の証拠のラインによって裏付けられた回答に収束させます。
信頼性と能力の限界(Capability Frontier)
Claude Mythos Previewを使用してデータを分析した結果、Anthropicは、2つのセットの間で「勝利」の信頼性に明確な違いがあることを見出しました。
- 信頼できる勝利: 人間が解決可能な問題において、Opus 4.6は成功した問題の86%を、5回中少なくとも4回解決しており、これは信頼できる手法であることを示しています。
- 脆弱な勝利: 人間が困難なタスクにおいて、「脆弱な勝利」(5回中1〜2回しか解決できなかった場合)の割合が44%に急増しました。
これは、モデルが最も困難な問題に切り込むことはできるものの、一貫貫通して再現可能な解決策ではなく、しばしば「運」による推論論理によって達成されていることを示唆しています。
業界の収束と今後の展望
Anthropicは、これらの結果が、GenentechとRocheがリリースした同様のベンチマークであるCompBioBenchの結果と一致していることに注目しています。その評価において、Claude Opus 4.6は、全体的な精度が81%に達し、最も困難な質問に対しては69%に達しました。これは、バイオインフォマティクス研究における有用な協力者としてのフロンティア・モデルの研究における有用な協力者としてのフロンティア・モデルの役割をさらに強固にするものです。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch