ALTK-Evolve: 為 LLM 效能校準代理記憶

IBM Research 證明了代理記憶(agentic memory)——即從過去的軌跡中提煉教訓並轉化為指南的過程——並非一項通用功能,而是一種必須根據模型的特定能力進行校準的「劑量」。使用 ALTK-Evolve 框架,研究人員發現,雖然強大的模型能從全面的指南集中受益,但較弱的模型在擁有精簡的核心指南與特定任務檢索時表現更好,而某些已飽和的模型則完全沒有增益。

The ALTK-Evolve Memory Loop

ALTK-Evolve 實作了一個發生在模型周圍而非模型內部的學習迴圈,這意味著不需要更新模型權重,也不需要人工標註。該過程遵循四個主要步驟:

  1. Trajectory Generation: 代理嘗試執行任務並產生執行軌跡。
  2. Guideline Extraction: ALTK-Evolve 從成功與失敗的執行中提取行為指南(有效的策略、應避免的錯誤以及邊緣案例)。
  3. Consolidation: 這些指南被整合為一個可重複使用的集合。
  4. Inference Injection: 在推理階段,代理會獲得完整的指南集或從中精選出的指南。

Model Capability and Memory Dosage

對八種涵蓋不同規模與架構的模型進行評估,揭示了模型吸收代理記憶的三種不同模式:

Strong Models with Headroom

具有顯著容量的模型可以吸收並應用完整的指南集,包括針對罕見邊緣案例的指南。例如,DeepSeek-V3.2 (671B MoE) 在提供其完整的自我提煉指南集時,其任務目標完成率 (TGC) 提升了 +9.5 個百分點 (pp)

Weak or Selective Models

較小或較弱的模型可能會被龐大的指南集淹沒。這些模型在「精選檢索」策略下表現最佳:即由高置信度的核心指南輔以少數與任務相關的指南。gpt-oss-120b (117B MoE) 使用精選檢索實現了 +16.1pp 的 TGC 增益,而使用完整的指南集效果較差,且會使 token 成本增加約 50%。

Saturated Models

某些模型無論配置如何,都無法從代理記憶中獲得可衡量的增益。GLM-5 (745B MoE) 表現出這種模式,這表明該模型可能已在測試任務中達到其效能天花板,或者無法有效地應用所提供的指南。

Performance Benchmarks on AppWorld

該框架在 AppWorld 上進行了評估,該平台包含九個模擬應用程式中的 585 個多步驟任務。效能是使用任務目標完成率 (TGC) 和更嚴格的 場景目標完成率 (SGC) 來衡量的,後者要求代理必須通過場景的所有變體才能算作成功。

Model Pattern Baseline TGC / SGC Best-memory TGC / SGC Best config $\Delta$ TGC $\Delta$ SGC
gpt-oss-120b Weak / selective 39.9 / 21.4 56.0 / 37.5 curated retrieval +16.1 +16.1
DeepSeek-V3.2 Strong w/ headroom 79.8 / 64.3 89.3 / 80.4 full guideline set +9.5 +16.1
Claude Opus 4.6 Strong w/ headroom 90.5 / 87.5 94.6 / 94.6 full guideline set +4.1 +7.1
GPT-5.5 Strong (near-ceiling) 92.3 / 82.1 95.2 / 89.3 full guideline set +2.9 +7.2
GLM-5 Saturated 87.5 / 80.4 87.5 / 80.4 full guideline set 0.0 0.0

值得注意的是,SGC 的增益通常比 TGC 的增益更大,這表明自我提煉的指南顯著提升了代理在不同場景變體下的可靠性。

Cost and Efficiency Trade-offs

注入記憶會增加每個 ReAct 步驟的輸入 token 數量,但影響因策略而異:

  • Curated Retrieval Efficiency: 對於像 gpt-oss-120b 這樣的模型,精選檢索提供了最高的準確度增益 (+16.1pp TGC) 且開銷極小 (+5% tokens)。
  • Full Set Overhead: DeepSeek-V3.2 在使用完整指南集時,每個任務的 token 數量增加了 +78%。
  • Optimization via Caching: 由於指南集在各個步驟中是靜態的,因此在生產環境中使用 prompt caching 可以大幅降低「完整指南集」策略的有效成本。

Future Research Directions

IBM Research 指出了 ALTK-Evolve 框架進一步開發的幾個領域:

  • Learned Selectors: 使用在結果信號上訓練的選擇器來取代餘弦相似度檢索,以更好地預測哪些指南有助於特定任務。
  • Teacher-Distilled Memory: 探索針對極弱模型(缺乏自我提煉所需的內部信號)的記憶機制。
  • Context Window Isolation: 進行受控實驗以確定上下文窗口大小,而非僅僅是原始能力,是否會影響模型吸收完整指南集的能力。

Sources

相關