ALTK-Evolve: LLM 성능을 위한 에이전트 메모리 보정

IBM Research는 에이전트 메모리—과거 실행 경로에서 교훈을 요약하여 지침으로 만드는 과정—가 보편적인 특성은 아니며, 모델의 특정 능력에 따라 조정되어야 한다는 것을 입증했다. ALTK-Evolve 프레임워크를 사용해 연구진은 강력한 모델은 포괄적인 지침 세트를 활용할 때 유리하지만, 약한 모델은 작고 핵심적인 지침 세트와 작업에 특화된 검색 전략을 선호하며, 일부 포화된 모델은 어떤 구성에서도 성능 향상이 없다는 것을 발견했다.

ALTK-Evolve 메모리 루프

ALTK-Evolve는 모델 내부가 아니라 모델 주변에서 발생하는 학습 루프를 구현한다. 즉, 모델 가중치가 업데이트되지 않으며, 인간의 주석도 필요하지 않다. 이 과정은 네 가지 주요 단계로 구성된다:

  1. 경로 생성: 에이전트가 작업을 시도하고 실행 경로를 생성한다.
  2. 지침 추출: ALTK-Evolve는 성공적이고 실패한 실행 모두에서 행동 지침(성공한 전략, 피해야 할 실수, 예외 케이스)을 추출한다.
  3. 통합: 이러한 지침들을 재사용 가능한 세트로 통합한다.
  4. 추론 주입: 추론 시점에 에이전트는 전체 지침 세트 또는 그 중 일부를 선택적으로 제공받는다.

모델 능력과 메모리 복용량

다양한 크기와 아키텍처를 가진 8개의 모델에 대한 평가를 통해, 모델이 에이전트 메모리를 어떻게 흡수하는지에 대해 세 가지 명확한 패턴이 드러났다.

여유 능력이 있는 강력한 모델

충분한 능력을 가진 모델은 전체 지침 세트, 희귀한 예외 케이스에 대한 지침까지도 흡수하고 적용할 수 있다. 예를 들어, DeepSeek-V3.2 (671B MoE) 는 자체적으로 추출한 전체 지침 세트를 제공받았을 때 Task Goal Completion (TGC)+9.5 percentage point (pp) 증가했다.

약하거나 선택적인 모델

작은 또는 약한 모델은 큰 지침 세트에 쉽게 과부하될 수 있다. 이러한 모델은 "선택적 검색" 전략에서 가장 좋은 성능을 보인다. 즉, 높은 신뢰도의 핵심 지침 세트에 작업에 관련된 몇 가지 지침을 추가하는 방식이다. gpt-oss-120b (117B MoE) 는 선택적 검색을 사용했을 때 TGC가 +16.1pp 향상되었지만, 전체 지침 세트는 성능이 낮아졌으며 토큰 비용은 약 50% 증가했다.

포화된 모델

일부 모델은 어떤 구성이든 에이전트 메모리에서 측정 가능한 성능 향상이 없다. GLM-5 (745B MoE) 는 이와 같은 패턴을 보였으며, 이는 테스트된 작업에서 이미 성능 한계에 도달했거나 제공된 지침을 효과적으로 적용하지 못할 수 있음을 시사한다.

AppWorld에서의 성능 벤치마크

이 프레임워크는 9개의 시뮬레이션 애플리케이션에 걸쳐 585개의 다단계 작업으로 구성된 AppWorld에서 평가되었다. 성능은 Task Goal Completion (TGC)과 더 엄격한 Scenario Goal Completion (SGC)을 사용해 측정되었으며, SGC는 특정 시나리오의 모든 변형을 통과해야 성공하는 조건을 요구한다.

모델 패턴 베이스라인 TGC / SGC 최적 메모리 TGC / SGC 최적 구성 $\Delta$ TGC $\Delta$ SGC
gpt-oss-120b 약하거나 선택적 39.9 / 21.4 56.0 / 37.5 선택적 검색 +16.1 +16.1
DeepSeek-V3.2 여유 능력이 있는 강력한 모델 79.8 / 64.3 89.3 / 80.4 전체 지침 세트 +9.5 +16.1
Claude Opus 4.6 여유 능력이 있는 강력한 모델 90.5 / 87.5 94.6 / 94.6 전체 지침 세트 +4.1 +7.1
GPT-5.5 강력한 모델(성능 한계 근접) 92.3 / 82.1 95.2 / 89.3 전체 지침 세트 +2.9 +7.2
GLM-5 포화된 모델 87.5 / 80.4 87.5 / 80.4 전체 지침 세트 0.0 0.0

특히 SGC 향상은 TGC 향상보다 높은 경우가 많았으며, 이는 자가 요약된 지침이 시나리오 변형 간 에이전트의 신뢰도를 크게 향상시킨다는 것을 시사한다.

비용과 효율성의 트레이드오프

메모리 주입은 모든 ReAct 단계의 입력 토큰 수를 늘리지만, 전략에 따라 영향은 다르다:

  • 선택적 검색의 효율성: gpt-oss-120b와 같은 모델에서는 선택적 검색이 최소한의 부담(+5% 토큰)으로 가장 높은 정확도 향상(+16.1pp TGC)을 제공했다.
  • 전체 세트의 부담: DeepSeek-V3.2는 전체 지침 세트를 사용할 때 작업당 토큰 수가 +78% 증가했다.
  • 캐싱을 통한 최적화: 지침 세트는 단계 간에 변하지 않기 때문에, 프롬프트 캐싱을 통해 "전체 지침 세트" 전략의 실제 비용을 상당히 줄일 수 있다.

미래 연구 방향

IBM Research는 ALTK-Evolve 프레임워크의 추가 개발을 위한 몇 가지 영역을 제시한다:

  • 학습된 선택기: 코사인 유사도 검색을 성과 신호에 기반해 훈련된 선택기로 대체하여 특정 작업에 도움이 되는 지침을 더 잘 예측할 수 있도록 한다.
  • 교사-요약 메모리: 자가 요약이 불가능한 매우 약한 모델을 위한 메모리 탐색.
  • 컨텍스트 창 고립: 컨텍스트 창 크기(원시 능력이 아닌)가 모델이 전체 지침 세트를 흡수하는 능력에 영향을 미치는지 여부를 제어 실험을 통해 확인한다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • 프로젝트
  • Dispatch