centerforaisafety/hle

Humanity's Last Exam

何を解決するか

AIモデルの知識の限界を、広範な分野にわたる高難度で閉じた形式の学術ベンチマークによってテストする必要に対応します。これは、既存のテストセットを単に暗記するのではなく、人間の知識の最前線を押し広げるために設計された、類似のベンチマークの最終形です。

動作方法

2,500件のマルチモーダルな質問からなるデータセットを提供し、数学、人文科学、自然科学など、数十の分野をカバーしています。これらの質問は選択式または短答式であり、自動採点が可能です。openai-python インターフェースを使用したシンプルな評価パイプラインにより、予測を生成し、結果を評価できます。

対象ユーザー

人間の専門家と同等の高度な学術知識を評価する必要があるAI研究者やモデル開発者。

特徴

  • 数十の分野をカバーするマルチモーダルベンチマーク。
  • 専門家が開発した2,500問の質問。
  • モデル開発者が訓練データからデータセットをフィルタリングし、データ汚染を防ぐためにカニーアストリングを含む。
  • 選択式および短答式の回答に対する自動採点。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト