ALTK-Evolve: 为 LLM 性能校准智能体记忆

IBM Research 已经证明,智能体记忆(agentic memory)——即从过去的轨迹中提取教训并转化为指南的过程——并不是一个通用的特性,而是一种必须根据模型的特定能力进行校准的“剂量”。通过使用 ALTK-Evolve 框架,研究人员发现,虽然强大的模型受益于全面的指南集,但较弱的模型在拥有精简的核心指南和特定任务检索时表现更好,而一些饱和的模型则完全没有收益。

The ALTK-Evolve Memory Loop

ALTK-Evolve 实现了一个在模型周围而非模型内部发生的学习循环,这意味着不需要更新模型权重,也不需要人工标注。该过程遵循四个主要步骤:

  1. Trajectory Generation: 智能体尝试执行任务并产生执行轨迹。
  2. Guideline Extraction: ALTK-Evolve 从成功和失败的运行中提取行为指南(有效的策略、需要避免的错误以及边缘情况)。
  3. Consolidation: 这些指南被整合为一个可重用的集合。
  4. Inference Injection: 在推理阶段,为智能体提供完整的指南集或这些指南的精选部分。

Model Capability and Memory Dosage

通过对涵盖各种规模和架构的八个模型的评估,揭示了模型吸收智能体记忆的三种不同模式:

Strong Models with Headroom

具有显著容量的模型可以吸收并应用完整的指南集,包括针对罕见边缘情况的指南。例如,DeepSeek-V3.2 (671B MoE) 在提供其完整的自我挖掘指南集时,任务目标完成率 (TGC) 提升了 +9.5 个百分点 (pp)

Weak or Selective Models

较小或较弱的模型可能会被庞大的指南集所淹没。这些模型在使用“精选检索”策略时表现最佳:即由高置信度的核心指南辅以少量与任务相关的指南。gpt-oss-120b (117B MoE) 使用精选检索实现了 +16.1pp 的 TGC 提升,而完整的指南集效果较差,且使 token 成本增加了约 50%。

Saturated Models

一些模型无论配置如何,都无法从智能体记忆中获得可衡量的收益。GLM-5 (745B MoE) 表现出这种模式,这表明该模型可能已经在测试任务上达到了性能天花板,或者无法有效地应用所提供的指南。

Performance Benchmarks on AppWorld

该框架在 AppWorld 上进行了评估,AppWorld 由跨越九个模拟应用程序的 585 个多步任务组成。性能是通过任务目标完成率 (TGC) 和更严格的场景目标完成率 (SGC) 来衡量的,后者要求智能体通过场景的所有变体才能算作成功。

Model Pattern Baseline TGC / SGC Best-memory TGC / SGC Best config $\Delta$ TGC $\Delta$ SGC
gpt-oss-120b Weak / selective 39.9 / 21.4 56.0 / 37.5 curated retrieval +16.1 +16.1
DeepSeek-V3.2 Strong w/ headroom 79.8 / 64.3 89.3 / 80.4 full guideline set +9.5 +16.1
Claude Opus 4.6 Strong w/ headroom 90.5 / 87.5 94.6 / 94.6 full guideline set +4.1 +7.1
GPT-5.5 Strong (near-ceiling) 92.3 / 82.1 95.2 / 89.3 full guideline set +2.9 +7.2
GLM-5 Saturated 87.5 / 80.4 87.5 / 80.4 full guideline set 0.0 0.0

值得注意的是,SGC 的增益通常大于 TGC 的增益,这表明自我提取的指南显著提高了智能体在不同场景变体下的可靠性。

Cost and Efficiency Trade-offs

注入记忆会增加每个 ReAct 步的输入 token 数量,但其影响因策略而异:

  • Curated Retrieval Efficiency: 对于像 gpt-oss-120b 这样的模型,精选检索提供了最高的准确率增益 (+16.1pp TGC) 且开销极小 (+5% tokens)。
  • Full Set Overhead: DeepSeek-V3.2 在使用完整指南集时,每个任务的 token 数量增加了 +78%。
  • Optimization via Caching: 由于指南集在各步骤中是静态的,因此在生产环境中,使用 prompt caching 可以大幅降低“完整指南集”策略的有效成本。

Future Research Directions

IBM Research 确定了 ALTK-Evolve 框架进一步开发的几个领域:

  • Learned Selectors: 使用在结果信号上训练的选择器来取代余弦相似度检索,以更好地预测哪些指南有助于特定任务。
  • Teacher-Distilled Memory: 探索针对极弱模型(缺乏自我提取所需的内部信号)的记忆机制。
  • Context Window Isolation: 进行受控实验,以确定是上下文窗口大小而非原始能力影响了模型吸收完整指南集的能力。

Sources

相关