ALTK-Evolve: LLM 성능을 위한 에이전트 메모리 보정
IBM Research는 에이전트 메모리—과거 실행 경로에서 교훈을 요약하여 지침으로 만드는 과정—가 보편적인 특성은 아니며, 모델의 특정 능력에 따라 조정되어야 한다는 것을 입증했다. ALTK-Evolve 프레임워크를 사용해 연구진은 강력한 모델은 포괄적인 지침 세트를 활용할 때 유리하지만, 약한 모델은 작고 핵심적인 지침 세트와 작업에 특화된 검색 전략을 선호하며, 일부 포화된 모델은 어떤 구성에서도 성능 향상이 없다는 것을 발견했다.
ALTK-Evolve 메모리 루프
ALTK-Evolve는 모델 내부가 아니라 모델 주변에서 발생하는 학습 루프를 구현한다. 즉, 모델 가중치가 업데이트되지 않으며, 인간의 주석도 필요하지 않다. 이 과정은 네 가지 주요 단계로 구성된다:
- 경로 생성: 에이전트가 작업을 시도하고 실행 경로를 생성한다.
- 지침 추출: ALTK-Evolve는 성공적이고 실패한 실행 모두에서 행동 지침(성공한 전략, 피해야 할 실수, 예외 케이스)을 추출한다.
- 통합: 이러한 지침들을 재사용 가능한 세트로 통합한다.
- 추론 주입: 추론 시점에 에이전트는 전체 지침 세트 또는 그 중 일부를 선택적으로 제공받는다.
모델 능력과 메모리 복용량
다양한 크기와 아키텍처를 가진 8개의 모델에 대한 평가를 통해, 모델이 에이전트 메모리를 어떻게 흡수하는지에 대해 세 가지 명확한 패턴이 드러났다.
여유 능력이 있는 강력한 모델
충분한 능력을 가진 모델은 전체 지침 세트, 희귀한 예외 케이스에 대한 지침까지도 흡수하고 적용할 수 있다. 예를 들어, DeepSeek-V3.2 (671B MoE) 는 자체적으로 추출한 전체 지침 세트를 제공받았을 때 Task Goal Completion (TGC) 가 +9.5 percentage point (pp) 증가했다.
약하거나 선택적인 모델
작은 또는 약한 모델은 큰 지침 세트에 쉽게 과부하될 수 있다. 이러한 모델은 "선택적 검색" 전략에서 가장 좋은 성능을 보인다. 즉, 높은 신뢰도의 핵심 지침 세트에 작업에 관련된 몇 가지 지침을 추가하는 방식이다. gpt-oss-120b (117B MoE) 는 선택적 검색을 사용했을 때 TGC가 +16.1pp 향상되었지만, 전체 지침 세트는 성능이 낮아졌으며 토큰 비용은 약 50% 증가했다.
포화된 모델
일부 모델은 어떤 구성이든 에이전트 메모리에서 측정 가능한 성능 향상이 없다. GLM-5 (745B MoE) 는 이와 같은 패턴을 보였으며, 이는 테스트된 작업에서 이미 성능 한계에 도달했거나 제공된 지침을 효과적으로 적용하지 못할 수 있음을 시사한다.
AppWorld에서의 성능 벤치마크
이 프레임워크는 9개의 시뮬레이션 애플리케이션에 걸쳐 585개의 다단계 작업으로 구성된 AppWorld에서 평가되었다. 성능은 Task Goal Completion (TGC)과 더 엄격한 Scenario Goal Completion (SGC)을 사용해 측정되었으며, SGC는 특정 시나리오의 모든 변형을 통과해야 성공하는 조건을 요구한다.
| 모델 | 패턴 | 베이스라인 TGC / SGC | 최적 메모리 TGC / SGC | 최적 구성 | $\Delta$ TGC | $\Delta$ SGC |
|---|---|---|---|---|---|---|
| gpt-oss-120b | 약하거나 선택적 | 39.9 / 21.4 | 56.0 / 37.5 | 선택적 검색 | +16.1 | +16.1 |
| DeepSeek-V3.2 | 여유 능력이 있는 강력한 모델 | 79.8 / 64.3 | 89.3 / 80.4 | 전체 지침 세트 | +9.5 | +16.1 |
| Claude Opus 4.6 | 여유 능력이 있는 강력한 모델 | 90.5 / 87.5 | 94.6 / 94.6 | 전체 지침 세트 | +4.1 | +7.1 |
| GPT-5.5 | 강력한 모델(성능 한계 근접) | 92.3 / 82.1 | 95.2 / 89.3 | 전체 지침 세트 | +2.9 | +7.2 |
| GLM-5 | 포화된 모델 | 87.5 / 80.4 | 87.5 / 80.4 | 전체 지침 세트 | 0.0 | 0.0 |
특히 SGC 향상은 TGC 향상보다 높은 경우가 많았으며, 이는 자가 요약된 지침이 시나리오 변형 간 에이전트의 신뢰도를 크게 향상시킨다는 것을 시사한다.
비용과 효율성의 트레이드오프
메모리 주입은 모든 ReAct 단계의 입력 토큰 수를 늘리지만, 전략에 따라 영향은 다르다:
- 선택적 검색의 효율성: gpt-oss-120b와 같은 모델에서는 선택적 검색이 최소한의 부담(+5% 토큰)으로 가장 높은 정확도 향상(+16.1pp TGC)을 제공했다.
- 전체 세트의 부담: DeepSeek-V3.2는 전체 지침 세트를 사용할 때 작업당 토큰 수가 +78% 증가했다.
- 캐싱을 통한 최적화: 지침 세트는 단계 간에 변하지 않기 때문에, 프롬프트 캐싱을 통해 "전체 지침 세트" 전략의 실제 비용을 상당히 줄일 수 있다.
미래 연구 방향
IBM Research는 ALTK-Evolve 프레임워크의 추가 개발을 위한 몇 가지 영역을 제시한다:
- 학습된 선택기: 코사인 유사도 검색을 성과 신호에 기반해 훈련된 선택기로 대체하여 특정 작업에 도움이 되는 지침을 더 잘 예측할 수 있도록 한다.
- 교사-요약 메모리: 자가 요약이 불가능한 매우 약한 모델을 위한 메모리 탐색.
- 컨텍스트 창 고립: 컨텍스트 창 크기(원시 능력이 아닌)가 모델이 전체 지침 세트를 흡수하는 능력에 영향을 미치는지 여부를 제어 실험을 통해 확인한다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- 프로젝트
- Dispatch