ALTK-Evolve: 為 LLM 效能校準代理記憶
IBM Research 證明了代理記憶(agentic memory)——即從過去的軌跡中提煉教訓並轉化為指南的過程——並非一項通用功能,而是一種必須根據模型的特定能力進行校準的「劑量」。使用 ALTK-Evolve 框架,研究人員發現,雖然強大的模型能從全面的指南集中受益,但較弱的模型在擁有精簡的核心指南與特定任務檢索時表現更好,而某些已飽和的模型則完全沒有增益。
The ALTK-Evolve Memory Loop
ALTK-Evolve 實作了一個發生在模型周圍而非模型內部的學習迴圈,這意味著不需要更新模型權重,也不需要人工標註。該過程遵循四個主要步驟:
- Trajectory Generation: 代理嘗試執行任務並產生執行軌跡。
- Guideline Extraction: ALTK-Evolve 從成功與失敗的執行中提取行為指南(有效的策略、應避免的錯誤以及邊緣案例)。
- Consolidation: 這些指南被整合為一個可重複使用的集合。
- Inference Injection: 在推理階段,代理會獲得完整的指南集或從中精選出的指南。
Model Capability and Memory Dosage
對八種涵蓋不同規模與架構的模型進行評估,揭示了模型吸收代理記憶的三種不同模式:
Strong Models with Headroom
具有顯著容量的模型可以吸收並應用完整的指南集,包括針對罕見邊緣案例的指南。例如,DeepSeek-V3.2 (671B MoE) 在提供其完整的自我提煉指南集時,其任務目標完成率 (TGC) 提升了 +9.5 個百分點 (pp)。
Weak or Selective Models
較小或較弱的模型可能會被龐大的指南集淹沒。這些模型在「精選檢索」策略下表現最佳:即由高置信度的核心指南輔以少數與任務相關的指南。gpt-oss-120b (117B MoE) 使用精選檢索實現了 +16.1pp 的 TGC 增益,而使用完整的指南集效果較差,且會使 token 成本增加約 50%。
Saturated Models
某些模型無論配置如何,都無法從代理記憶中獲得可衡量的增益。GLM-5 (745B MoE) 表現出這種模式,這表明該模型可能已在測試任務中達到其效能天花板,或者無法有效地應用所提供的指南。
Performance Benchmarks on AppWorld
該框架在 AppWorld 上進行了評估,該平台包含九個模擬應用程式中的 585 個多步驟任務。效能是使用任務目標完成率 (TGC) 和更嚴格的 場景目標完成率 (SGC) 來衡量的,後者要求代理必須通過場景的所有變體才能算作成功。
| Model | Pattern | Baseline TGC / SGC | Best-memory TGC / SGC | Best config | $\Delta$ TGC | $\Delta$ SGC |
|---|---|---|---|---|---|---|
| gpt-oss-120b | Weak / selective | 39.9 / 21.4 | 56.0 / 37.5 | curated retrieval | +16.1 | +16.1 |
| DeepSeek-V3.2 | Strong w/ headroom | 79.8 / 64.3 | 89.3 / 80.4 | full guideline set | +9.5 | +16.1 |
| Claude Opus 4.6 | Strong w/ headroom | 90.5 / 87.5 | 94.6 / 94.6 | full guideline set | +4.1 | +7.1 |
| GPT-5.5 | Strong (near-ceiling) | 92.3 / 82.1 | 95.2 / 89.3 | full guideline set | +2.9 | +7.2 |
| GLM-5 | Saturated | 87.5 / 80.4 | 87.5 / 80.4 | full guideline set | 0.0 | 0.0 |
值得注意的是,SGC 的增益通常比 TGC 的增益更大,這表明自我提煉的指南顯著提升了代理在不同場景變體下的可靠性。
Cost and Efficiency Trade-offs
注入記憶會增加每個 ReAct 步驟的輸入 token 數量,但影響因策略而異:
- Curated Retrieval Efficiency: 對於像 gpt-oss-120b 這樣的模型,精選檢索提供了最高的準確度增益 (+16.1pp TGC) 且開銷極小 (+5% tokens)。
- Full Set Overhead: DeepSeek-V3.2 在使用完整指南集時,每個任務的 token 數量增加了 +78%。
- Optimization via Caching: 由於指南集在各個步驟中是靜態的,因此在生產環境中使用 prompt caching 可以大幅降低「完整指南集」策略的有效成本。
Future Research Directions
IBM Research 指出了 ALTK-Evolve 框架進一步開發的幾個領域:
- Learned Selectors: 使用在結果信號上訓練的選擇器來取代餘弦相似度檢索,以更好地預測哪些指南有助於特定任務。
- Teacher-Distilled Memory: 探索針對極弱模型(缺乏自我提煉所需的內部信號)的記憶機制。
- Context Window Isolation: 進行受控實驗以確定上下文窗口大小,而非僅僅是原始能力,是否會影響模型吸收完整指南集的能力。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- 專案
- Dispatch