neosigmaai/auto-harness
Bring your own agent and build a self-improving agentic system. Automatically mine failures, optimize the agent harness, and gate against regressions.
解決する課題
auto-harness は、AIコーディングエージェントの自動的な自己改善のためのフレームワークです。特定のベンチマークにおけるエージェントのパフォーマンスを向上させるために、システムプロンプトやツール定義を手動で反復調整する問題を解決します。人間が反復作業を行う代わりに、コーディングエージェントが別のエージェントのコードとプロンプトを最適化する役割を担い、自己改善ループを構築します。
仕組み
このシステムは、クローズドループの最適化プロセスとして動作します:
- 実行: システムはベンチマーク(例:Tau-bench、Terminal-Bench 2.0、または BIRD-Interact)を実行し、結果を記録します。
- 分析: コーディングエージェントがトレーニングセットの失敗トレースを分析し、エージェントがなぜ失敗したのかを診断します。
- 改善: コーディングエージェントがターゲットエージェントのファイル(
agent/agent.py)を編集し、システムプロンプトやツールを改善します。 - ゲート: すべての変更は3段階のゲートを通過します。過去に合格したタスクの回帰テストスイート、平均報酬が向上したことを確認するための全テストセット評価、そして新しい合格タスクを回帰スイートに追加するスイート昇格ステップです。
- 記録: 結果は履歴ログに追加され、エージェントは発見した内容を
learnings.mdファイルに記録します。 - 繰り返し: このプロセスが繰り返され、エージェントは夜間に反復学習を行うことができます。
対象ユーザー
LLMベースのエージェントの自己改善ループを自動化したい開発者やAI研究者。特に、ツール使用、SQL生成、またはターミナルベースのタスクに焦点を当てている方に適しています。
ハイライト
- ベンチマーク非依存: タスクごとの報酬を提供するあらゆるベンチマークで動作します。
- 自己管理型評価: コーディングエージェントが手動キュレーションなしで
suite.json回帰スイートを自動管理します。 - 構造的な不正防止: コーディングエージェントがテストトレースではなくトレーニングトレースのみにアクセスできるようにすることで、データ漏洩を防ぎます。
- 統合されたベンチマーク: Tau-bench、Terminal-Bench 2.0、BIRD-Interactを標準サポートしています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト