neosigmaai/auto-harness

Bring your own agent and build a self-improving agentic system. Automatically mine failures, optimize the agent harness, and gate against regressions.

解决的问题

auto-harness 是一个用于 AI 编码代理自动自我改进的框架。它解决了手动迭代系统提示词与工具定义以提升代理在特定基准测试中表现的问题。与其由人类开发者进行迭代,该框架指派一个编码代理来优化另一个代理的代码与提示词,从而建立一个自我改进的循环。

运作方式

该系统以闭环优化流程运作:

  1. 执行:系统执行基准测试(例如 Tau-bench、Terminal-Bench 2.0 或 BIRD-Interact)并记录结果。
  2. 分析:编码代理分析训练集中的失败追踪记录,以诊断代理失败的原因。
  3. 改进:编码代理编辑目标代理的文件(agent/agent.py)以改进其系统提示词或工具。
  4. 门控:每次变更都会通过三个步骤的门控:包含先前通过任务的回归测试套件、确保平均奖励提升的全测试集评估,以及将新通过任务加入回归套件的套件推广步骤。
  5. 记录:结果会附加到历史日志中,代理会将其发现记录在 learnings.md 文件中。
  6. 重复:流程重复进行,允许代理在夜间进行迭代。

适用对象

希望自动化基于 LLM 的代理之自我改进循环的开发者与 AI 研究人员,特别是专注于工具使用、SQL 生成或终端任务的领域。

特色亮点

  • 基准测试无关:适用于任何提供单任务奖励的基准测试。
  • 自我维护评估:编码代理自动管理 suite.json 回归套件,无需手动维护。
  • 结构性防作弊:确保编码代理仅能访问训练追踪记录而非测试追踪记录,防止数据泄露。
  • 整合基准测试:内置支持 Tau-bench、Terminal-Bench 2.0 与 BIRD-Interact。

相关

  • 项目
  • 项目
  • 项目
  • 项目