AMAP-ML/LongHorizon-Harness

The long-horizon computer-use harness. Run AI agents across desktop apps and the CLI for extended periods while preserving task state and making reliable progress on complex workflows. Features fresh-context execution, durable verified state, independent auditing, recoverable progress, and native Claude Code / Codex / OpenClaw integration.

何を解決するか

LongHorizon-Harness は、複数ステップ、アプリ間ワークフロー(GUI と CLI)を必要とする複雑で長時間実行されるタスクにおいて、AI エージェントが失敗する問題に対処します。単一のプロンプトやモデルの内部ループに頼るのではなく、数十時間にわたる作業においてエージェントが迷子になったり、進捗を幻覚的に報告したりすることを防ぐ、耐久性のある実行フレームワークを提供します。

動作方法

本プロジェクトは「ループエンジニアリング」を実装しており、既存のエージェントバックエンド(Claude Code、Codex、OpenCode、DeepSeek Harness など)を、計画・実行・検証の構造化されたサイクルでラップします。役割を3つの明確な役割に分担しています:

  • マネージャー:元の目標と検証済みの進捗から現在の状態を再構築し、次に実行する制限付きステップを計画します。
  • エクセキューター:新規コンテキストでデスクトップアプリまたはターミナル上で特定の操作を実行し、コンテキストウィンドウの肥大化を回避します。
  • オーディター:実際の結果(ファイル、ログ、UI)を独立して検証し、エクセキューターの主張が真であることを確認してから進捗をチェックポイント化します。

検証済みの結果のみが信頼できる状態として保存され、失敗は次の計画フェーズに情報を提供する証拠として記録されます。

対象ユーザー

既存の AI エージェントを、ターミナルとデスクトップアプリの両方で複雑なコンピュータ利用タスクを処理できる自律システムに変換したい開発者やパワーユーザー向けです。

特徴

  • クロス表面対応:ブラウザ、スプレッドシート、デザインツールなどの GUI アプリと、コード作成やシステム設定などの CLI でシームレスに動作します。
  • バックエンド非依存:Claude Code、Codex、OpenCode、DeepSeek Harness など、複数のエージェントバックエンドをサポートします。
  • 役割ベースアーキテクチャ:計画、実行、検証を分離することで信頼性を向上させ、エラーを低減します。
  • Webワークベンチ:React/FastAPI ダッシュボードを内蔵し、タスクの開始、役割の管理、リアルタイムでの実行との対話が可能になります。
  • 実証された効果:WeaveBench や OSWorld 2.0 などのベンチマークにおいて、単体エージェントと比較して顕著なパフォーマンス向上を示しています。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト