ALTK-Evolve vs ACE:相同的经验,更少的 Token
TL;DR
ALTK‑Evolve 实现的任务目标完成率与 ACE 持平或更优,同时消耗的 Token 仅为后者的四分之一到七分之一,因为它在推理时仅提供最相关的指南,而不是始终喂入整个 playbook。
两套系统的共同点
ACE (Agentic Context Engineering) 和 ALTK‑Evolve 都将智能体的过往轨迹视为经验 (lessons),并进行无损存储。每条经验作为一个独立对象保留,并带有支持计数 (support count),表示产生该经验的片段数量。这种设计避免了当模型被迫将大量经验总结为少数通用规则时,容易出现的*简洁偏见 (brevity bias)和上下文崩溃 (context collapse)*问题。
"计数,而不是压缩。" — 这是 ACE 的逐条计数器与 ALTK‑Evolve 的支持计数器背后的共同原则。
两套系统的差异
记忆构建
- ACE 通过 Generator → Reflector → Curator 循环构建一个单一的演进式 playbook。近乎重复的经验会被聚类并合并;幸存的条目继承合并后的支持计数,从而保留经验的溯源性。
- ALTK‑Evolve 创建一组扁平的指南 (guidelines),每条指南都有自己的支持计数。经验不会被合并到单个文档中;相反,它们保持为可单独检索的状态。
交付机制(Token 成本驱动因素)
- ACE 在每一个推理步骤中都会将整个 playbook 注入到 prompt 中,无论模型规模或任务难度如何。
- ALTK‑Evolve 将交付视为一个可配置的旋钮:始终包含一小部分高支持度的核心指南,并根据任务使用余弦相似度或 LLM 引导的排名来选择额外的指南。当模型拥有足够的上下文窗口时,可以使用完整的整合集;否则仅发送最相关的子集。
这种交付选择直接解释了下文报告的 Token 使用差距。
AppWorld 基准测试的实证比较
所有实验均使用相同的 ReAct 代码智能体基础和相同的任务划分 (AppWorld test_normal, 168 个任务)。结果为单次运行的 pass@1 分数。
| 模型 | 系统 | TGC ↑ | SGC ↑ | 每个任务的 Tokens |
|---|---|---|---|---|
| DeepSeek‑V3.2 | ACE | 80.4 / 73.2 | 634 K | |
| ALTK‑Evolve | 89.3 / 80.4 | 263 K | ||
| gpt‑oss‑120b | ACE | 54.8 / 35.7 | 777 K | |
| ALTK‑Evolve | 56.0 / 37.5 | 116 K |
在更强的模型 (gpt‑oss‑120b) 上,ALTK‑Evolve 在仅使用 ACE 约 15% Token 预算的情况下实现了更高的 TGC。在较弱的模型 (DeepSeek‑V3.2) 上,它以约 40% 的 Token 成本达到了与 ACE 相当的准确率。
基于难度的细分
DeepSeek‑V3.2 (图 1 右侧面板)
- ALTK‑Evolve 在简单 (Easy)、困难 (Hard) 和总体 (Overall) 维度上胜出。
- ACE 在中等 (Medium) 维度上略占优势。
gpt‑oss‑120b (图 1 左侧面板)
- ACE 在简单和中等维度上领先,因为完整的 playbook 有助于强模型理解通用指令。
- ALTK‑Evolve 在困难任务中占据主导地位,在这些任务中,选择正确的经验比单纯的容量更重要,这种优势提升了总分。
该图说明,选择性检索有利于更难的任务,而完整的 playbook 对于较简单、更通用的子任务可能更有利。
为什么交付至关重要
Token 的差异完全源于交付 (delivery) 阶段。ACE 固定大小的注入迫使模型在每一步都处理整个 playbook,无论模型的上下文容量如何,都会膨胀 prompt 长度。ALTK‑Evolve 的自适应检索将 prompt 裁剪至模型实际可以关注的内容,在不牺牲(有时甚至提高)性能的情况下降低了推理成本。
欢迎尝试 ALTK‑Evolve library 以获取提取、整合和检索流水线,或阅读 完整技术报告 获取详细的消融实验。
相关资源与参考文献
- ALTK‑Evolve introduction – https://huggingface.co/blog/ibm-research/altk-evolve
- ACE (Agentic Context Engineering) – https://arxiv.org/abs/2510.04618
- AppWorld benchmark – https://appworld.dev/appworld
- ALTK‑Evolve code – https://github.com/AgentToolkit/altk-evolve
- Full technical report – https://arxiv.org/abs/2603.10600
方法论细节
- 基准测试: AppWorld
test_normal, 跨 9 个模拟应用的 168 个多步任务。 - 智能体: ReAct 代码智能体 (生成 Python 步骤,环境返回输出)。
- 指标: TGC (任务目标完成率) 和 SGC (场景目标完成率)。按每个任务计算 Token,包括所有 prompt 内容。
- 记忆来源: 仅从训练/开发划分中挖掘的经验;无人工标签。
- 基准差异: 两个系统的 ReAct prompt 模板不同,导致不同的无记忆基准 (72.0 vs 79.8 TGC)。比较侧重于添加记忆后的相对增益,而非绝对基准差距。
参考表格
DeepSeek‑V3.2 – test_normal
| 系统 | # 指南 | TGC | SGC | 每个任务的 Tokens |
|---|---|---|---|---|
| ReAct, no memory | 0 | 79.8 | 64.3 | 148 K |
| ReAct + ACE | 106 | 80.4 | 73.2 | 634 K |
| ReAct + ALTK‑Evolve | 191 | 89.3 | 80.4 | 263 K |
gpt‑oss‑120b – test_normal
| 系统 | # 指南 | TGC | SGC | 每个任务的 Tokens |
|---|---|---|---|---|
| ReAct, no memory | 0 | 39.9 | 21.4 | 110 K |
| ReAct + ACE (full) | full | 54.8 | 35.7 | 777 K |
| ReAct + ALTK‑Evolve (selected) | ~29 | 56.0 | 37.5 | 116 K |
gpt‑oss‑120b – 难度细分 (TGC)
| 难度 | 基准 | ACE | ALTK‑Evolve |
|---|---|---|---|
| Easy | 66.7 | 84.2 | 82.5 |
| Medium | 35.4 | 60.4 | 56.2 |
| Hard | 19.1 | 23.8 | 31.8 |
| 总体 (Aggregate) | 39.9 | 54.8 | 56.0 |
核心结论
ACE 和 ALTK‑Evolve 都证明了智能体记忆 (agentic memory)——即将智能体自身的经验转化为可重用的经验——可以在不进行任何权重更新的情况下提高多步任务的性能。实际部署的关键因素是这些经验是如何交付的:一种经过校准、感知任务的检索策略 (ALTK‑Evolve) 可以在大幅削减推理 Token 消耗的同时,保持甚至提高准确率。
Sources
相关
- Dispatch
- Dispatch
- 项目
- Dispatch