centerforaisafety/hle
Humanity's Last Exam
何を解決するか
AIモデルの知識の限界を、広範な分野にわたる高難度で閉じた形式の学術ベンチマークによってテストする必要に対応します。これは、既存のテストセットを単に暗記するのではなく、人間の知識の最前線を押し広げるために設計された、類似のベンチマークの最終形です。
動作方法
2,500件のマルチモーダルな質問からなるデータセットを提供し、数学、人文科学、自然科学など、数十の分野をカバーしています。これらの質問は選択式または短答式であり、自動採点が可能です。openai-python インターフェースを使用したシンプルな評価パイプラインにより、予測を生成し、結果を評価できます。
対象ユーザー
人間の専門家と同等の高度な学術知識を評価する必要があるAI研究者やモデル開発者。
特徴
- 数十の分野をカバーするマルチモーダルベンチマーク。
- 専門家が開発した2,500問の質問。
- モデル開発者が訓練データからデータセットをフィルタリングし、データ汚染を防ぐためにカニーアストリングを含む。
- 選択式および短答式の回答に対する自動採点。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト