alexisfox7/PRO-LONG
Programmatic memory for long-horizon LLM agents: the harness appends everything to one log, and the agent searches it with code. 97.4% on ARC-AGI-3 (arXiv:2607.20064)
解决的问题
PRO-LONG 解决了 LLM 代理在长周期推理中的挑战,特别针对 ARC-AGI-3 游戏集中的复杂任务。它通过提供持久且可编程的内存,防止代理在长时间动作序列中丢失进度或遗忘关键观察。
工作原理
PRO-LONG 不依赖模型的上下文窗口,而是使用一个最小的内存扩展:一个结构化的 log.txt 文件,记录每一次观察、动作和结果。代理可以使用 grep 和 Python 等工具,程序化地检索和推理历史,而不是将整个历史强行塞入提示中。这种方法仅使用非常短的系统提示(约 30 行),避免了复杂的子代理或专用检索系统。
适用人群
专为开发和研究能够解决长周期推理任务的 LLM 代理的开发者和研究人员设计,尤其适用于针对 ARC-AGI-3 基准测试的场景。
主要亮点
- 显著的性能提升:在 ARC-AGI-3 公开游戏集上,相比标准编码代理提升了 18 个百分点。
- 极高的 Token 效率:在使用 4.2–5.8 倍更少的计费 Token 的情况下,性能达到或超过专用工具。
- 高准确率:使用 Fable 5 达到了 97.4% 的 best@2 成绩。
- 灵活的后端支持:通过 Docker 容器支持 OpenAI Codex 和 Claude Code CLI 两种后端。
相关
- 项目
- 项目
- 项目
- 项目
- 项目