harbor-framework/terminal-bench
Measuring and evolving with the frontier of agent work
解决的问题
Terminal-Bench 是一个旨在衡量前沿 AI 代理能力的基准测试。它提供了一组多样且具有挑战性的高质量任务,这些任务会随时间不断演化,使代理开发者能够追踪进展,并比较不同代理和模型的性能表现。
工作原理
基于 Harbor 框架构建,该基准测试包含一组可在沙箱环境中(如 Modal)运行的任务数据集。用户可以通过指定要使用的代理和模型,使用 Harbor CLI 工具运行基准测试。项目通过带标签的发布版本和公开排行榜,维持一个持续的基准测试。
适用对象
适用于希望评估其代理处理复杂、现实世界中基于终端任务能力的前沿 AI 代理开发者。
主要亮点
- 具有持续演进任务的基准测试,防止性能停滞。
- 与 Harbor 框架集成,实现标准化执行。
- 支持沙箱环境,确保安全且可靠的代理执行。
- 提供公开排行榜,用于比较代理和模型的性能。
相关
- 项目
- 项目
- 项目
- 项目