neosigmaai/auto-harness

Bring your own agent and build a self-improving agentic system. Automatically mine failures, optimize the agent harness, and gate against regressions.

解決する課題

auto-harness は、AIコーディングエージェントの自動的な自己改善のためのフレームワークです。特定のベンチマークにおけるエージェントのパフォーマンスを向上させるために、システムプロンプトやツール定義を手動で反復調整する問題を解決します。人間が反復作業を行う代わりに、コーディングエージェントが別のエージェントのコードとプロンプトを最適化する役割を担い、自己改善ループを構築します。

仕組み

このシステムは、クローズドループの最適化プロセスとして動作します:

  1. 実行: システムはベンチマーク(例:Tau-bench、Terminal-Bench 2.0、または BIRD-Interact)を実行し、結果を記録します。
  2. 分析: コーディングエージェントがトレーニングセットの失敗トレースを分析し、エージェントがなぜ失敗したのかを診断します。
  3. 改善: コーディングエージェントがターゲットエージェントのファイル(agent/agent.py)を編集し、システムプロンプトやツールを改善します。
  4. ゲート: すべての変更は3段階のゲートを通過します。過去に合格したタスクの回帰テストスイート、平均報酬が向上したことを確認するための全テストセット評価、そして新しい合格タスクを回帰スイートに追加するスイート昇格ステップです。
  5. 記録: 結果は履歴ログに追加され、エージェントは発見した内容を learnings.md ファイルに記録します。
  6. 繰り返し: このプロセスが繰り返され、エージェントは夜間に反復学習を行うことができます。

対象ユーザー

LLMベースのエージェントの自己改善ループを自動化したい開発者やAI研究者。特に、ツール使用、SQL生成、またはターミナルベースのタスクに焦点を当てている方に適しています。

ハイライト

  • ベンチマーク非依存: タスクごとの報酬を提供するあらゆるベンチマークで動作します。
  • 自己管理型評価: コーディングエージェントが手動キュレーションなしで suite.json 回帰スイートを自動管理します。
  • 構造的な不正防止: コーディングエージェントがテストトレースではなくトレーニングトレースのみにアクセスできるようにすることで、データ漏洩を防ぎます。
  • 統合されたベンチマーク: Tau-bench、Terminal-Bench 2.0、BIRD-Interactを標準サポートしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト