alexisfox7/PRO-LONG

Programmatic memory for long-horizon LLM agents: the harness appends everything to one log, and the agent searches it with code. 97.4% on ARC-AGI-3 (arXiv:2607.20064)

解決的問題

PRO-LONG 解決了 LLM 代理在長周期推理中的挑戰,特別針對 ARC-AGI-3 遊戲集中的複雜任務。它透過提供持久且可程式化的記憶,防止代理在長時間動作序列中遺失進度或遺忘關鍵觀察。

工作原理

PRO-LONG 不依賴模型的上下文視窗,而是使用一個最小的記憶擴展:一個結構化的 log.txt 檔案,記錄每一次觀察、動作和結果。代理可以使用 grep 和 Python 等工具,程式化地檢索和推理歷史,而不是將整個歷史強行塞入提示中。這種方法僅使用非常短的系統提示(約 30 行),避免了複雜的子代理或專用檢索系統。

適用對象

專為開發和研究能夠解決長周期推理任務的 LLM 代理的開發者和研究人員設計,尤其適用於針對 ARC-AGI-3 基準測試的場景。

主要亮點

  • 顯著的性能提升:在 ARC-AGI-3 公開遊戲集上,相比標準編碼代理提升了 18 個百分點。
  • 極高的 Token 效率:在使用 4.2–5.8 倍更少的計費 Token 的情況下,性能達到或超過專用工具。
  • 高準確率:使用 Fable 5 達到了 97.4% 的 best@2 成績。
  • 靈活的後端支援:透過 Docker 容器支援 OpenAI Codex 和 Claude Code CLI 兩種後端。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案