AMAP-ML/LongHorizon-Harness

The long-horizon computer-use harness. Run AI agents across desktop apps and the CLI for extended periods while preserving task state and making reliable progress on complex workflows. Features fresh-context execution, durable verified state, independent auditing, recoverable progress, and native Claude Code / Codex / OpenClaw integration.

解決的問題

LongHorizon-Harness 解決了 AI 代理在複雜、長時間執行的任務中失敗的問題,這些任務需要多步驟、跨應用程式工作流程(GUI 與 CLI),以及可靠的驗證機制。它不依賴單一提示或單一模型的內部循環,而是提供一個持久的執行框架,防止代理在數十小時的工作中迷失方向或虛構進度。

工作原理

本專案實作了「循環工程」,將現有的代理後端(如 Claude Code、Codex、OpenCode 或 DeepSeek Harness)封裝在一個結構化的計畫-執行-驗證循環中。它將職責劃分為三個明確的角色:

  • 管理者:從原始目標和已驗證的進展中重建當前狀態,規劃下一個有界步驟。
  • 執行者:在桌面應用程式或終端中以全新上下文執行具體操作,避免上下文視窗膨脹。
  • 審計員:獨立驗證實際結果(檔案、日誌、UI),確保執行者的聲稱真實無誤後,才將進度保存為檢查點。

只有經過驗證的結果才會被保存為可信狀態;失敗則作為證據記錄,用於指導下一個規劃回合。

適用對象

希望將現有 AI 代理轉變為能夠處理終端與桌面應用程式中複雜電腦任務的自主系統的開發者與高階使用者。

主要亮點

  • 跨介面能力:在 GUI 應用程式(瀏覽器、試算表、設計工具)與 CLI(程式設計、系統設定)中無縫運行。
  • 後端無關性:支援多種代理後端,包括 Claude Code、Codex、OpenCode 與 DeepSeek Harness。
  • 角色化架構:分離計畫、執行與驗證,提升可靠性並減少錯誤。
  • Web 工作台:內建 React/FastAPI 仪表板,支援啟動任務、管理角色,並即時互動運行過程。
  • 實證成效:在 WeaveBench 與 OSWorld 2.0 等基準測試中,相比獨立代理展現出顯著的效能提升。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案