AMAP-ML/LongHorizon-Harness

The long-horizon computer-use harness. Run AI agents across desktop apps and the CLI for extended periods while preserving task state and making reliable progress on complex workflows. Features fresh-context execution, durable verified state, independent auditing, recoverable progress, and native Claude Code / Codex / OpenClaw integration.

解决的问题

LongHorizon-Harness 解决了 AI 代理在复杂、长时间运行的任务中失败的问题,这些任务需要多步操作、跨应用工作流(GUI 和 CLI),以及可靠的验证机制。它不依赖单一提示或单一模型的内部循环,而是提供一个持久的执行框架,防止代理在数十小时的工作中迷失方向或虚构进展。

工作原理

该项目实现了「循环工程」,将现有的代理后端(如 Claude Code、Codex、OpenCode 或 DeepSeek Harness)封装在一个结构化的计划-执行-验证循环中。它将职责划分为三个明确的角色:

  • 管理者:从原始目标和已验证的进展中重建当前状态,规划下一个有界步骤。
  • 执行者:在桌面应用或终端中以全新上下文执行具体操作,避免上下文窗口膨胀。
  • 审计员:独立验证实际结果(文件、日志、UI),确保执行者的声明真实无误后,才将进展保存为检查点。

只有经过验证的结果才会被保存为可信状态;失败则作为证据记录,用于指导下一轮的规划。

适用人群

希望将现有 AI 代理转变为能够处理终端和桌面应用程序中复杂计算机任务的自主系统的开发者和高级用户。

主要亮点

  • 跨界面能力:在 GUI 应用(浏览器、电子表格、设计工具)和 CLI(编程、系统配置)中无缝运行。
  • 后端无关性:支持多种代理后端,包括 Claude Code、Codex、OpenCode 和 DeepSeek Harness。
  • 角色化架构:分离计划、执行和验证,提高可靠性并减少错误。
  • Web 工作台:内置 React/FastAPI 仪表板,支持启动任务、管理角色,并实时交互运行过程。
  • 实证成效:在 WeaveBench 和 OSWorld 2.0 等基准测试中,相比独立代理展现出显著的性能提升。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目