ByteDance-Seed/EdgeBench

EdgeBench: Unveiling scaling laws of learning from real-world environments

解決的問題

EdgeBench 解決了 AI 代理一次性性能基準的限制。它不衡量單次嘗試,而是評估代理在長時間(每項任務最多達 12 小時以上)內,透過與真實環境的迭代互動來學習與改進的能力,追蹤進步的軌跡,而不僅僅是最終結果。

如何運作

EdgeBench 包含六個類別(科學與機器學習、系統與軟體工程、最佳化、知識、形式化、遊戲)中的 134 個真實世界任務,其中 51 個任務已公開。它使用專用評估工具 SForge,採用雙容器隔離系統:一個「工作」容器供代理操作,一個隱藏的「裁判」容器執行測試。代理會收到提交內容的細粒度反饋,並可在封閉迴圈中反覆迭代,直到逾時為止。

適用對象

專為希望衡量其模型如何從環境反饋中學習並隨時間擴展性能的自主 AI 代理研究人員與開發者設計。

主要亮點

  • 長周期評估:每項任務可追蹤 12 小時以上的代理進展。
  • 雙容器隔離:透過分離工作環境與裁判環境,防止評估作弊。
  • 發現縮放定律:發現代理性能隨互動時間呈對數-邏輯斯蒂(log-sigmoid)縮放規律。
  • SForge 框架:提供支援 Kubernetes 後端的可擴展框架,用於執行大規模代理評估。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案