Lemmalog: 使用 Datalog 将 LLM 记忆转化为程序分析
在长期调查中保持一致的状态是 LLM 智能体的一个主要失效模式。在漏洞研究等复杂任务中,模型经常会忘记之前已被排除的假设,或者继续基于已被证伪的观察结果进行推理。Lemmalog 通过将 LLM 记忆视为程序分析问题而非检索问题来解决这一问题,利用 Datalog 引擎来维护一个确定性的演绎状态。
问题:LLM 记忆中的状态衰减
标准的 LLM 记忆系统通常依赖向量数据库和语义搜索 (RAG)。虽然这些系统在检索相关的过去对话方面很有效,但在处理“真理”和状态更新方面却很吃力。如果一个智能体确定了 object_a 指向 object_b,随后发现这是错误的,向量数据库只会简单地存储这两个相互矛盾的陈述。LLM 随后必须在提示词中协调这些矛盾,这往往会导致幻觉或死掉的假设重新抬头。
Lemmalog 的架构:分离模糊逻辑与确定性逻辑
Lemmalog 将记忆问题拆分为两个不同的组件:用于提取的概率性前端和用于推理的确定性后端。
1. 模糊前端 (LLM)
LLM 被用作解析器,将非结构化数据(如源代码、调试器输出和自然语言笔记)转换为结构化事实。例如,“LLDB 显示被释放的对象随后被重新使用”这一陈述会被转换为正式事实:freed(object_a) 和 reused_as(object_a, write_target)。
2. 确定性后端 (Datalog)
一旦事实被结构化,Lemmalog 就会使用 Datalog(一种声明式逻辑编程语言)根据预定义的规则推导出新事实。这确保了结论在逻辑上是严密的,并且会自动更新。
关键能力包括:
- 增量评估: 当输入事实发生变化时,只有受影响的结论会被更新,而不是重新运行整个调查。
- 自动撤回: 如果用于推导结论的事实被移除,除非该结论由另一个独立的推导路径支持,否则该结论会自动失效。
- 溯源追踪: 系统为每个推导出的事实维护一个依赖图,允许智能体通过追溯其原始观察结果来回答“为什么”某个特定结论是正确的。
- 时效性有效性: 事实与有效性区间相关联(例如,
viable(primitive_a) [10:14, 12:37)),允许系统追踪知识随时间演变的过程,而不会维持矛盾的状态。
性能基准测试
Lemmalog 在 LongMemEval 和 LoCoMo 基准测试中进行了测试,以评估其处理长期对话记忆的能力。
LongMemEval 结果
Lemmalog 实现了 0.463 +/- 0.010 的 F1 分数和 0.575 +/- 0.004 的准确率。虽然略逊于 PropMem 等一些专门的记忆系统,但它显著优于全上下文提示 (GPT-4.1),后者的 F1 分数为 0.197。
至关重要的是,Lemmalog 大幅降低了上下文窗口的需求。对于 LongMemEval,回答模型接收到的每个问题大约为 2,700 个 token,而全上下文方法则需要 104,000 个 token——上下文规模缩小了 38 倍。
LoCoMo 结果
在规模更大的 LoCoMo 基准测试(1,986 个问题)中,Lemmalog 实现了 0.533 +/- 0.001 的 F1 分数,在专用记忆系统中排名第三。与全上下文模型(0.509 F1)相比,它在对抗性问题(0.707 F1)中表现尤为出色,因为结构化记忆可以明确识别出支持性事实的缺失,而不是被语义相似性所误导。
对比:演绎状态 vs. 经验记忆
Lemmalog 为智能体记忆提出了一种混合架构,区分了演绎状态与经验记忆:
| 特性 | 演绎状态 (Lemmalog) | 经验记忆 (向量数据库) |
|---|---|---|
| 性质 | 事实、规则、时间 | 模糊上下文 |
| 机制 | 溯源与撤回 | 语义检索 |
| 存储 | 维护的状态 | 源文本 |
| 优势 | 逻辑一致性、真理 | 相关性、细微差别 |
社区见解与反论点
技术同行之间的讨论突出了这种方法的潜力以及其历史背景:
"LLM 应该只真正地坐在请求履行方面的终端位置……在这些终端之间,工作应该是基于某种本体论或正式知识结构的机械推理。"
一些贡献者指出,这种方法反映了“经典老式人工智能” (GOFAI) 和符号人工智能,并警告说该系统最终可能会面临符号逻辑的经典挑战,例如对量词的需求以及处理“模糊”或基于观点的信息的难度。其他人建议探索 Answer Set Programming (ASP) 以获得更强大的非单调逻辑,从而处理事实的“遗忘”问题。
结论
Lemmalog 表明,对于需要逻辑一致性和状态追踪的任务,维护一个正式的分析状态比增加上下文窗口更有效。通过将 LLM 作为确定性 Datalog 引擎的概率性解析器,该系统降低了 token 成本并防止了已证伪假设的重新抬头,为长期自主研究智能体提供了一条可扩展的路径。
Sources
相关
- 项目
- Dispatch
- Dispatch
- Dispatch
- Dispatch