ALTK-Evolve vs ACE:相同的经验,更少的 Token

TL;DR

ALTK‑Evolve 实现的任务目标完成率与 ACE 持平或更优,同时消耗的 Token 仅为后者的四分之一到七分之一,因为它在推理时仅提供最相关的指南,而不是始终喂入整个 playbook。


两套系统的共同点

ACE (Agentic Context Engineering) 和 ALTK‑Evolve 都将智能体的过往轨迹视为经验 (lessons),并进行无损存储。每条经验作为一个独立对象保留,并带有支持计数 (support count),表示产生该经验的片段数量。这种设计避免了当模型被迫将大量经验总结为少数通用规则时,容易出现的*简洁偏见 (brevity bias)上下文崩溃 (context collapse)*问题。

"计数,而不是压缩。" — 这是 ACE 的逐条计数器与 ALTK‑Evolve 的支持计数器背后的共同原则。

两套系统的差异

记忆构建

  • ACE 通过 Generator → Reflector → Curator 循环构建一个单一的演进式 playbook。近乎重复的经验会被聚类并合并;幸存的条目继承合并后的支持计数,从而保留经验的溯源性。
  • ALTK‑Evolve 创建一组扁平的指南 (guidelines),每条指南都有自己的支持计数。经验不会被合并到单个文档中;相反,它们保持为可单独检索的状态。

交付机制(Token 成本驱动因素)

  • ACE 在每一个推理步骤中都会将整个 playbook 注入到 prompt 中,无论模型规模或任务难度如何。
  • ALTK‑Evolve 将交付视为一个可配置的旋钮:始终包含一小部分高支持度的核心指南,并根据任务使用余弦相似度或 LLM 引导的排名来选择额外的指南。当模型拥有足够的上下文窗口时,可以使用完整的整合集;否则仅发送最相关的子集。

这种交付选择直接解释了下文报告的 Token 使用差距。


AppWorld 基准测试的实证比较

所有实验均使用相同的 ReAct 代码智能体基础和相同的任务划分 (AppWorld test_normal, 168 个任务)。结果为单次运行的 pass@1 分数。

模型 系统 TGC ↑ SGC ↑ 每个任务的 Tokens
DeepSeek‑V3.2 ACE 80.4 / 73.2 634 K
ALTK‑Evolve 89.3 / 80.4 263 K
gpt‑oss‑120b ACE 54.8 / 35.7 777 K
ALTK‑Evolve 56.0 / 37.5 116 K

在更强的模型 (gpt‑oss‑120b) 上,ALTK‑Evolve 在仅使用 ACE 约 15% Token 预算的情况下实现了更高的 TGC。在较弱的模型 (DeepSeek‑V3.2) 上,它以约 40% 的 Token 成本达到了与 ACE 相当的准确率。

基于难度的细分

DeepSeek‑V3.2 (图 1 右侧面板)

  • ALTK‑Evolve 在简单 (Easy)困难 (Hard)总体 (Overall) 维度上胜出。
  • ACE 在中等 (Medium) 维度上略占优势。

gpt‑oss‑120b (图 1 左侧面板)

  • ACE 在简单中等维度上领先,因为完整的 playbook 有助于强模型理解通用指令。
  • ALTK‑Evolve 在困难任务中占据主导地位,在这些任务中,选择正确的经验比单纯的容量更重要,这种优势提升了总分。

该图说明,选择性检索有利于更难的任务,而完整的 playbook 对于较简单、更通用的子任务可能更有利。


为什么交付至关重要

Token 的差异完全源于交付 (delivery) 阶段。ACE 固定大小的注入迫使模型在每一步都处理整个 playbook,无论模型的上下文容量如何,都会膨胀 prompt 长度。ALTK‑Evolve 的自适应检索将 prompt 裁剪至模型实际可以关注的内容,在不牺牲(有时甚至提高)性能的情况下降低了推理成本。

欢迎尝试 ALTK‑Evolve library 以获取提取、整合和检索流水线,或阅读 完整技术报告 获取详细的消融实验。


相关资源与参考文献


方法论细节

  • 基准测试: AppWorld test_normal, 跨 9 个模拟应用的 168 个多步任务。
  • 智能体: ReAct 代码智能体 (生成 Python 步骤,环境返回输出)。
  • 指标: TGC (任务目标完成率) 和 SGC (场景目标完成率)。按每个任务计算 Token,包括所有 prompt 内容。
  • 记忆来源: 仅从训练/开发划分中挖掘的经验;无人工标签。
  • 基准差异: 两个系统的 ReAct prompt 模板不同,导致不同的无记忆基准 (72.0 vs 79.8 TGC)。比较侧重于添加记忆后的相对增益,而非绝对基准差距。

参考表格

DeepSeek‑V3.2 – test_normal

系统 # 指南 TGC SGC 每个任务的 Tokens
ReAct, no memory 0 79.8 64.3 148 K
ReAct + ACE 106 80.4 73.2 634 K
ReAct + ALTK‑Evolve 191 89.3 80.4 263 K

gpt‑oss‑120b – test_normal

系统 # 指南 TGC SGC 每个任务的 Tokens
ReAct, no memory 0 39.9 21.4 110 K
ReAct + ACE (full) full 54.8 35.7 777 K
ReAct + ALTK‑Evolve (selected) ~29 56.0 37.5 116 K

gpt‑oss‑120b – 难度细分 (TGC)

难度 基准 ACE ALTK‑Evolve
Easy 66.7 84.2 82.5
Medium 35.4 60.4 56.2
Hard 19.1 23.8 31.8
总体 (Aggregate) 39.9 54.8 56.0

核心结论

ACE 和 ALTK‑Evolve 都证明了智能体记忆 (agentic memory)——即将智能体自身的经验转化为可重用的经验——可以在不进行任何权重更新的情况下提高多步任务的性能。实际部署的关键因素是这些经验是如何交付的:一种经过校准、感知任务的检索策略 (ALTK‑Evolve) 可以在大幅削减推理 Token 消耗的同时,保持甚至提高准确率。

Sources

相关

  • Dispatch
  • Dispatch
  • 项目
  • Dispatch