harbor-framework/terminal-bench-science
Terminal-Bench-Science: Evaluating AI agents on research workflows across scientific domains
解决的问题
Terminal-Bench-Science 提供了一种标准化的方法,用于衡量 AI 代理在处理复杂、真实世界科学研究工作流方面的表现。它填补了通用 AI 能力与生命科学、物理科学、地球科学、数学和工程科学等科学领域所需的专门化、专家级任务之间的差距。
如何工作
该项目是一个持续的基准测试,包含由领域专家精心策划的任务,并在终端环境中进行客观验证。它使用 Harbor 框架将代理运行在这些任务上。该基准通过社区驱动的流程不断演进,领域专家提出、构建并评审任务,以确保其对前沿 AI 模型始终保持挑战性和相关性。
适用对象
此基准测试专为开发代理的 AI 研究人员,以及希望贡献真实工作场景任务以支持 AI 系统的科学领域专家而设计。
主要亮点
- 专家策划:任务由五个广泛科学领域的专家撰写并评审。
- 客观可验证:所有任务均能在终端环境中生成可验证的结果。
- 社区驱动:拥有透明的任务提案、实现和评审流程。
- 防污染机制:使用 Canary 字符串帮助训练数据流水线检测并排除基准数据,防止其进入训练语料库。
相关
- 项目
- 项目
- 项目
- 项目
- 项目