ABBEL: 教授LLM更新信念以实现高效长时交互
ABBEL: 教授LLM更新信念以实现高效长时交互
BAIR 已经推出 ABBEL,一个旨在通过用监督的自然语言“信念状态”替换完整交互历史来使大型语言模型(LLM)在长时交互中保持高效内存的框架。此方法解决了在递归自摘要中通常出现的性能下降问题,特别是在高质量训练数据稀缺的领域。
递归摘要的问题
随着任务范围扩展到数百或数千步——例如在协作软件开发中——在模型的上下文中维护完整的交互历史变得不切实际。当前的行业标准是“上下文压缩”或递归摘要,即模型摘要自身的历史以节省空间。
然而,BAIR 发现存在一个关键的性能差距:使用自摘要的模型即使在强化学习(RL)微调后,也常常无法缩小与完整上下文模型之间的性能差距。这归因于学习问题复杂性的增加以及创建有效的人类模拟器以生成高质量训练环境的困难。
ABBEL: 通过信念瓶颈行动
ABBEL 通过将摘要制定为信念状态来隔离摘要生成任务。与一般摘要不同,模型会定期根据新信息被提示更新这些信念状态,这一做法受到递归贝叶斯估计的启发。
信念评分
为了提高这些摘要的质量,ABBEL 引入了“信念评分”,这是一个辅助的强化学习任务,用于监督信念状态的信息内容。这是通过两种主要方法实现的:
- 通用重建评分: 受自编码器启发的函数,其中模型既充当编码器又充当解码器。信念状态的评分基于模型使用它来重建历史中最新观察的效果如何。
- 领域知识评分: 在特定环境中,评分器使用已知的启发式方法(例如,计算历史上的统计信息)以确保信念状态保留关键信息。
性能基准
BAIR 在三个不同的环境中测试了 ABBEL,以衡量其效率和内存使用情况:
协作编码(CollabBench)
使用 CollabBench 环境,ABBEL(基于重建的信念评分,ABBEL-rec-BG)相比标准摘要展示了显著改进:
- 性能恢复: 它将基于摘要的模型与完整上下文模型之间的性能差距减少了大约 50%。
- 训练效率: 它所需的训练步骤减少了 50%(50 步 vs. 100 步)。
- 内存效率: 相比完整上下文模型,它保持了更低的峰值上下文标记长度。
组合锁
在组合锁环境(类似 Wordle 的游戏)中,使用领域知识信念评分的 ABBEL 的性能接近或超过了完整上下文模型,显示出比未使用信念评分的模型更高的学习效率。
多目标问答
在多目标问答任务中,BAIR 发现将信念状态与推理隔离可以允许出现“峰值信念长度惩罚(PBP)”。此惩罚在性能仅轻微下降的情况下显著降低内存使用,这一结果与惩罚推理长度时通常看到的性能下降形成对比。
与其他内存策略的比较
ABBEL 与其他长上下文管理策略在以下几方面有所不同:
- 上下文压缩: 与密集表示不同,ABBEL 的信念状态是自然语言且易于人类理解的。
- 手动设计的提示/修剪: 与静态提示不同,ABBEL 允许代理作为其决策策略的一部分学习记住什么。
- 外部内存存储: ABBEL 与 RAG 风格的外部内存互补,因为它可以提升随后被查询的上下文的创建。
AI 内存的未来方向
BAIR 建议显式信念状态可以通过奖励改善信念状态的行为来引导探索,促进代理之间的更好沟通,或允许用户直接修改代理的内存以获得更好的可控性。
未来的研究可能会探索结合多种内存形式——例如工作内存(上下文)、短期内存和长期内存(模型权重或适配器内存)——以处理仅靠文本无法表示的信息或在一生交互中积累的技能。