alexisfox7/PRO-LONG

Programmatic memory for long-horizon LLM agents: the harness appends everything to one log, and the agent searches it with code. 97.4% on ARC-AGI-3 (arXiv:2607.20064)

해결하는 문제

PRO-LONG은 LLM 에이전트의 장기적 추론 문제를 해결하며, 특히 ARC-AGI-3 게임 세트에서 볼 수 있는 복잡한 작업에 특화되어 있습니다. 모델의 컨텍스트 창에만 의존하지 않고 지속적이고 프로그래밍 가능한 메모리를 제공함으로써, 긴 액션 시퀀스 동안 진행 상황을 잃거나 중요한 관찰을 잊는 것을 방지합니다.

작동 방식

모델의 컨텍스트 창에만 의존하는 것이 아니라, PRO-LONG은 모든 관찰, 액션, 결과를 기록하는 구조화된 log.txt 파일이라는 최소한의 메모리 추가를 사용합니다. 에이전트는 전체 기록을 프롬프트에 넣는 대신, grep 및 Python과 같은 도구를 사용하여 이 기록을 프로그래밍적으로 가져와 추론할 수 있습니다. 이 접근법은 매우 짧은 시스템 프롬프트(약 30줄)를 사용하며, 복잡한 서브에이전트나 전용 검색 시스템을 피합니다.

대상 사용자

장기적 추론 작업을 해결할 수 있는 LLM 에이전트를 개발하거나 연구하는 개발자 및 연구자, 특히 ARC-AGI-3 벤치마크에 초점을 맞춘 사람들에게 적합합니다.

주요 특징

  • 매우 뛰어난 성능 향상: ARC-AGI-3 공개 게임 세트에서 표준 코딩 에이전트보다 18% 포인트 향상.
  • 토큰 효율성: 전용 허니스와 동등하거나 그 이상의 성능을 발휘하면서도, 청구 대상 토큰 수를 4.2~5.8배 줄였습니다.
  • 높은 정확도: Fable 5에서 best@2 기준 97.4% 달성.
  • 유연한 백엔드: Docker 컨테이너를 통해 OpenAI Codex와 Claude Code CLI 백엔드 모두 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트