ByteDance-Seed/EdgeBench

EdgeBench: Unveiling scaling laws of learning from real-world environments

解决的问题

EdgeBench 解决了 AI 代理单次性能基准的局限性。它不衡量单次尝试,而是评估代理在长时间(每项任务长达 12 小时以上)内通过与真实环境的迭代交互来学习和改进的能力,追踪改进的轨迹,而不仅仅是最终结果。

如何工作

EdgeBench 包含 6 个类别(科学与机器学习、系统与软件工程、优化、知识、形式化、游戏)中的 134 个真实世界任务,其中 51 个任务已公开。它使用一种名为 SForge 的专用评估框架,采用双容器隔离系统:一个“工作”容器用于代理操作,一个隐藏的“裁判”容器用于执行测试。代理会收到对其提交的细粒度反馈,并可在封闭循环中迭代,直到超时为止。

适用对象

专为希望衡量其模型如何从环境反馈中学习并随时间扩展性能的自主 AI 代理研究人员和开发者设计。

主要亮点

  • 长周期评估:每项任务可追踪 12 小时以上的代理进展。
  • 双容器隔离:通过分离工作环境和裁判环境,防止评估作弊。
  • 发现缩放定律:发现代理性能随交互时间呈对数-逻辑斯蒂(log-sigmoid)缩放规律。
  • SForge 框架:提供支持 Kubernetes 后端的可扩展框架,用于运行大规模代理评估。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目