AMAP-ML/LongHorizon-Harness

The long-horizon computer-use harness. Run AI agents across desktop apps and the CLI for extended periods while preserving task state and making reliable progress on complex workflows. Features fresh-context execution, durable verified state, independent auditing, recoverable progress, and native Claude Code / Codex / OpenClaw integration.

해결하는 문제

LongHorizon-Harness는 복잡하고 장시간 실행되는 작업에서 AI 에이전트가 실패하는 문제를 해결합니다. 이 작업들은 여러 단계를 거치며 GUI와 CLI 환경 간의 워크플로우를 필요로 하며, 신뢰할 수 있는 검증이 필요합니다. 단일 프롬프트나 단일 모델의 내부 루프에 의존하는 것이 아니라, 수십 시간에 걸친 작업에서도 에이전트가 방향을 잃거나 진전을 환상적으로 보고하는 것을 방지하는 내구성 있는 실행 프레임워크를 제공합니다.

작동 방식

이 프로젝트는 기존의 에이전트 백엔드(Claude Code, Codex, OpenCode, DeepSeek Harness 등)를 계획-실행-검증의 구조화된 사이클로 감싸는 '루프 엔지니어링'을 구현합니다. 책임을 세 가지 명확한 역할로 나눕니다:

  • 매니저: 원래 목표와 검증된 진척 상황에서 현재 상태를 재구성하여 다음 제한된 단계를 계획합니다.
  • 실행자: 새로운 컨텍스트를 사용해 데스크톱 앱 또는 터미널에서 특정 작업을 수행하여 컨텍스트 창의 과도한 증가를 방지합니다.
  • 감사자: 실제 결과(파일, 로그, UI)를 독립적으로 검증하여 실행자의 주장이 진실임을 확인한 후에만 진척 상황을 체크포인트로 저장합니다.

검증된 결과만 신뢰할 수 있는 상태로 저장되며, 실패는 다음 계획 라운드에 정보를 제공하는 증거로 기록됩니다.

대상 사용자

터미널과 데스크톱 애플리케이션 양쪽에서 복잡한 컴퓨터 작업을 처리할 수 있는 자율 시스템으로 기존 AI 에이전트를 전환하고자 하는 개발자 및 고급 사용자에게 적합합니다.

주요 특징

  • 크로스 서피스 기능: 브라우저, 스프레드시트, 디자인 도구 등의 GUI 앱과 코드 작성, 시스템 설정 등의 CLI 환경에서 원활하게 작동합니다.
  • 백엔드 독립성: Claude Code, Codex, OpenCode, DeepSeek Harness 등 다양한 에이전트 백엔드를 지원합니다.
  • 역할 기반 아키텍처: 계획, 실행, 검증을 분리함으로써 신뢰성 향상과 오류 감소를 달성합니다.
  • 웹 워크벤치: React/FastAPI 대시보드를 포함하여 작업 시작, 역할 관리, 실시간 실행 상호작용이 가능합니다.
  • 실증된 성과: WeaveBench 및 OSWorld 2.0와 같은 벤치마크에서 단일 에이전트보다 뚜렷한 성능 향상을 보여줍니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트