harbor-framework/terminal-bench

Measuring and evolving with the frontier of agent work

解决的问题

Terminal-Bench 是一个旨在衡量前沿 AI 代理能力的基准测试。它提供了一组多样且具有挑战性的高质量任务,这些任务会随时间不断演化,使代理开发者能够追踪进展,并比较不同代理和模型的性能表现。

工作原理

基于 Harbor 框架构建,该基准测试包含一组可在沙箱环境中(如 Modal)运行的任务数据集。用户可以通过指定要使用的代理和模型,使用 Harbor CLI 工具运行基准测试。项目通过带标签的发布版本和公开排行榜,维持一个持续的基准测试。

适用对象

适用于希望评估其代理处理复杂、现实世界中基于终端任务能力的前沿 AI 代理开发者。

主要亮点

  • 具有持续演进任务的基准测试,防止性能停滞。
  • 与 Harbor 框架集成,实现标准化执行。
  • 支持沙箱环境,确保安全且可靠的代理执行。
  • 提供公开排行榜,用于比较代理和模型的性能。

相关

  • 项目
  • 项目
  • 项目
  • 项目