china-qijizhifeng/agentic-harness-engineering

Official AHE code — Agentic Harness Engineering: observability-driven automatic evolution of coding-agent harnesses (concurrent w/ meta-harness). NexAU-AHE reaches 84.7% ± 2.1 pass@1 on Terminal-Bench 2 (GPT-5.5). Lifts GPT-5.4 69.7→77.0% over 10 iters, beats Codex/ACE/Training-Free GRPO; frozen harness transfers to SWE-bench-Verified.

何を解決するか

コーディングエージェントの「ハーネス」(周囲のインフラ)を手動で最適化する困難さに対処します。ベースとなるLLMのファインチューニングではなく、計算コストが高い作業を避け、AHEはシステムのプロンプト、ツールの説明、ツールの実装、ミドルウェア、スキル、サブエージェント、長期記憶を自動的に進化させることで、コーディングタスクにおけるエージェントのパフォーマンスを向上させます。

動作方法

AHEは、3つの観測レイヤーに基づいた反復的な 評価 → 分析 → 改善 ループを使用します:

  1. コンポーネント観測:NexAUを使用してハーネスを7つのGit管理・監査可能なコンポーネントに分解します。
  2. 経験観測:エージェントデバッガーが膨大な実行トレースをソース付きレポートに要約し、失敗の根本原因を特定します。
  3. 意思決定観測:エボルブエージェントが根拠に基づいたハーネスの編集を提案し、その影響を予測し、その後の評価結果を使って予測を反証または確認します。

すべての展開は、安全性和再現性を確保するため、隔離されたE2Bサンドボックス内で実行されます。

対象ユーザー

ベースモデルの再トレーニングなしにエージェントのパフォーマンスを体系的に改善したいAIエンジニアや研究者

主な特徴

  • 固定されたベースモデル:モデルの重みではなく、環境とツールを最適化します。
  • 根拠に基づく:すべての変更は失敗の証拠と予測された影響に基づく必要があります。
  • モデル間移行性:進化したハーネスは、異なるベースモデルに移行可能で、再進化は不要です。
  • 高いパフォーマンス:Terminal-Bench 2.0で顕著なパス率向上を実証しました。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト