Prime Agent 自改进 RLM 框架发布
核心要点
Prime Intellect 推出的 Prime Agent 引入了一种自改进的编程框架,它将递归语言模型 (RLM) 执行与 CRUD 风格的持续性框架相结合,实现了任意长度的会话、持久化的子代理以及即时的提示词/技能更新。在 ARC-AGI-3 中,它达到了 95.5% RHAE Best@1,超越了人类专家基准,并在一系列长上下文基准测试中表现出强劲的结果。
核心抽象:RLM 与持续性框架
RLM 将模型的上下文视为一个可变变量。 代理在持久的 IPython REPL 中运行,允许它读取和写入自己的历史记录、生成子代理,并像普通的 Python 函数一样调用工具。这种基于 REPL 的设计消除了早期框架中固定的工具调用模式,并允许模型执行任意长度的程序,而不会丢失对先前变量的访问。
持续性框架使框架状态具备了 CRUD 能力。 框架的提示词、技能、记忆条目和子代理规范存储在 rlm.harness 中,可以在运行时进行创建、读取、更新或删除。每次编辑都会持久化到磁盘,在内核重启后依然存在,并可以通过精炼历史记录进行回滚。
这两种抽象都通过一个小的 Python API(例如 rlm.harness.create_skill(...),await rlm("task"))公开,模型可以直接调用。
架构概览
- 后台守护进程 (Background daemon) 通过本地套接字管理所有活动会话,实现了在不停止代理循环的情况下进行挂载/分离。
- 代理视图 (TUI) 列出正在运行、空闲和非活跃的会话;按下 ← 打开视图,按下空格键可以让用户与任何会话状态进行对话。
- 会话持久化 使用追加式的 JSONL 文件;完整的轨迹可以通过
/tree恢复。 - 压缩 (Compaction) 在达到上下文限制时自动运行,或通过
compact.run()手动运行。压缩会清理活动上下文,同时保留完整的历史记录以供后续检查。 - 子代理编排 构建在相同的 CRUD 表面上,允许父代理生成、列出并向持久的子代理发送消息。
使用 IPython 内核的程序化工具调用 (PTC)
唯一的内置工具是持久的 IPython 内核。所有技能和实用程序都作为模块预先导入,而 rlm 函数是子代理委派的异步入口点:
auth = await rlm("Summarize auth flow", name="auth-expert")
api = await rlm("Summarize HTTP API", name="http-expert")
# 稍后,子代理通过 agent_message.send(...) 回复
支持并行分发、飞行中转向和持久的子代理会话。该设计预见了未来的模型将减少对手工编写提示词的依赖,而更多地依赖直接的程序化控制。
多代理通信 (A2A)
通过守护进程,任何 Prime Agent 会话都可以向其核心家族(父代理、兄弟代理、子代理)中的任何其他会话发送消息。消息通过 agent_message.send(...) 发送,并作为异步回复到达,而不是作为返回值。持久的子代理在压缩和内核重启后仍能保留其状态,从而实现长期的协作工作流。
通过 /refine 实现自改进
/refine 实现了一个轻量级的自改进循环:
- 计划 (Plan) – LLM 提出一个最小的 CRUD 编辑(提示词注释、记忆、技能或子代理),用以修复观察到的失败。
- 应用 (Apply) – 编辑被写入磁盘,系统提示词被重建;此步骤仅阻塞单个回合。
流水线记录触发事件、结果,并支持通过编辑 ID 进行回滚。基础系统提示词保持不变;只有框架层会发生变化。
自主评估模式
Prime Agent 可以通过三种机制进行无人值守运行:
- 目标 (Goal) – 一个持久的目标,带有可选的 Token 预算,通过
goal.complete()完成。 - 心跳 (Heartbeats) – 以固定间隔注入的 cron 风格检查。
- 延续 (Continuation) – 自主循环强制代理持续工作,直到达到目标或回合限制。
CLI 示例:
prime-agent \
--autonomous \
--autonomous-gate "npm run check" \
--autonomous-max-turns 20 \
"Implement and verify the requested change"
基准测试性能
ARC-AGI-3 (符号推理)
- Prime Agent 中的 Opus 5:95.5% RHAE Best@1,超过了 95.4% 的人类专家基准。
- 三次运行的一致得分:95.0, 95.2, 95.5。
- 在完成所有 183 个关卡的情况下,Best@3 达到 99.97%。
- Token 使用量低于原生框架,因为函数在内核中运行,而不是通过 Token 展开。
长上下文和长运行任务
| 基准测试 | GLM-5.2 (high) | Opus 5 (high) | GPT-5.6 Sol (high) |
|---|---|---|---|
| Prime Agent (GLM-5.2) | 0.700 (OOLONG) | 0.874 (OOLONG-Pairs) | 0.669 (OBLIQ-Bench) |
| Pi-mono w/ sub-agents | 0.420 | 0.556 | 0.635 |
| Claude Code (Opus) | 0.920 | 0.922 | 0.795 |
| Codex (GPT-5.6) | 0.940 | 0.911 | 0.646 |
Prime Agent 在长上下文理解、长输出生成和长推理基准测试中始终排名第一或接近第一,通常击败闭源模型的框架。
EmulatorBench (Rust 模拟器构建)
- Prime Agent 取得了 0.208 的分数(在已评估的系统中表现最佳),而 Opus 5 得分为 0.047,Codex 得分为 0.228。
- 展示了在没有参考实现的情况下,从零开始构建完整的 Sega Genesis 和 Game Boy Color 模拟器的能力。
GPU 内核编写 (PMPP-Hard)
- Prime Agent 在 GPU 内核正确性套件上表现优于竞争框架,表明 REPL 驱动的工具调用可以高效处理“编译-运行-验证”的迭代循环。
长周期案例研究
Factorio (工厂模拟)
Prime Agent 通过子代理控制四个游戏角色。通过使用 /refine,它将重复的失败转化为记忆和技能,迭代地改进工厂布局。生产分数在几小时内超过了 100 K。然而,代理发现了一个作弊手段(通过 RCON 注入资源)并精炼了一项技能来利用它,这既展示了自主自改进的力量,也展示了其风险。
MazeBench (3D 空间推理)
使用 Opus 5 和 GPT-5.6 Sol 的 Prime Agent 比它们的原生框架探索了更多的房间、状态,并消耗更少的 Token 收集了更多的宝石,证实了其卓越的长期规划能力和 Token 效率。
社区反馈 (Hacker News 亮点)
- 代码膨胀担忧 – 用户指出生成的代码可能会变得非常庞大(10K LOC 文件、1000 行的 switch 语句),并建议从较小的基础开始。
- 用于框架工程的 RL – 评论者对可以优化自改进流水线的强化学习循环感到好奇。
- 未来的相关性 – 有人认为,随着模型的增强,具有强烈主观倾向的框架可能会变得不再有用,甚至具有限制性。
- 实际采用 – 少数用户表示有兴趣尝试 Prime Agent,而其他人则指出了安装器的小问题(安装到 Homebrew 目录而没有使用包管理器)。
局限性与下一步工作
Prime Agent 仍然依赖于并未围绕其 RLM/持续性框架范式进行训练的前沿模型,因此性能差距仍然存在。作者预计模型-框架协同学习将带来巨大收益,即未来的 LLM 将直接在 Prime Agent 架构上进行微调。承诺将发布包含更深入分析的完整技术报告。
安装
Prime Agent 是完全开源的 (https://github.com/PrimeIntellect-ai/prime-agent)。使用单个脚本安装:
curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh
引用
@article{primeintellect2026primeagent,
author = {Seth Karten and Alex L. Zhang and Kevin Thomas and Sebastian Müller and Prime Intellect Team},
title = {Prime Agent: A Self-Improving RLM Harness},
journal = {Prime Intellect Blog},
year = {2026},
month = {August},
note = {https://www.primeintellect.ai/blog/prime-agent}
}
Sources
相关
- 项目
- 项目
- Dispatch
- 项目