ABBEL: 효율적인 장기 상호작용을 위해 LLM에게 믿음 업데이트 가르치기
ABBEL: 효율적인 장기 상호작용을 위해 LLM에게 믿음 업데이트 가르치기
BAIR은 LLMs(대형 언어 모델)가 전체 상호작용 기록을 감독된 자연어 "믿음 상태"로 대체함으로써 장기 상호작용 동안 효율적인 메모리를 유지할 수 있도록 설계된 프레임워크인 ABBEL을 도입했습니다. 이 접근법은 고품질 학습 데이터가 부족한 분야에서 특히 재귀적 자기 요약에서 일반적으로 나타나는 성능 저하를 해결합니다.
재귀적 요약의 문제점
작업 범위가 수백 또는 수천 단계로 확장될 때—예를 들어 협업 소프트웨어 개발과 같은 경우—모델의 컨텍스트에서 전체 상호작용 기록을 유지하는 것은 비실용적입니다. 현재 업계 표준은 "컨텍스트 압축" 또는 재귀적 요약으로, 모델이 공간을 절약하기 위해 자신의 기록을 요약하는 것입니다.
그러나 BAIR은 자기 요약을 사용하는 모델이 강화 학습(RL) 미세 조정을 거친 후에도 전체 컨텍스트 모델과의 성능 격차를 줄이지 못하는 경우가 많다는 중요한 성능 격차를 발견했습니다. 이는 학습 문제의 복잡성이 증가했고, 고품질 학습 환경을 생성할 수 있는 효과적인 인간 시뮬레이터를 만드는 것이 어렵기 때문입니다.
ABBEL: 믿음 병목점을 통한 행동
ABBEL은 믿음 상태로 요약을 형식화함으로써 요약 생성 작업을 분리합니다. 일반적인 요약 대신, 모델은 새로운 정보를 기반으로 이러한 믿음 상태를 주기적으로 업데이트하도록 프롬프트되며, 이는 재귀 베이지안 추정에서 영감을 얻었습니다.
믿음 등급
이러한 요약의 품질을 향상시키기 위해 ABBEL은 "믿음 등급"이라는 보조 RL 작업을 도입하여 믿음 상태의 정보 내용을 감독합니다. 이는 두 가지 주요 방법을 통해 달성됩니다:
- 일반 재구성 기반 등급: 모델이 인코더와 디코더 दोनों 역할을 하는 자동인코더에서 영감을 받은 함수입니다. 믿음 상태는 모델이 이를 사용하여 기록에서 가장 최근 관찰을 재구성하는 데 얼마나 잘 사용되는지에 따라 등급이 매겨집니다.
- 도메인 지식 등급: 특정 환경에서는 등급기가 알려진 휴리스틱(예: 기록에 대한 통계 계산)을 사용하여 믿음 상태가 중요한 정보를 유지하도록 보장합니다.
성능 벤치마크
BAIR은 ABBEL을 세 가지 distinct 환경에서 테스트하여 효율성과 메모리 사용량을 측정했습니다.
협업 코딩 (CollabBench)
CollabBench 환경을 사용하여, 재구성 기반 믿음 등급이 적용된 ABBEL(ABBEL-rec-BG)은 표준 요약에 비해 상당한 개선을 보여주었습니다:
- 성능 회복: 요약 기반 모델과 전체 컨텍스트 모델 사이의 성능 격차를 약 50% 줄였습니다.
- 훈련 효율성: 훈련 단계가 50% 적게 필요했습니다(50 단계 vs. 100 단계).
- 메모리 효율성: 전체 컨텍스트 모델에 비해 피크 컨텍스트 토큰 길이가 낮게 유지되었습니다.
조합 잠금
조합 잠금 환경(Wordle과 유사한 게임)에서, 도메인 지식 믿음 등급을 사용하는 ABBEL은 전체 컨텍스트 모델의 성능에 접근하거나 이를 초과했으며, 믿음 등급이 없는 모델보다 더 높은 학습 효율성을 보였습니다.
다목적 질문 answering
다목적 QA 작업에서, BAIR은 믿음 상태를 추론으로부터 분리함으로써 "믿음 길이 피크 페널티(PBP)"를 허용할 수 있음을 발견했습니다. 이 페널티는 성능 저하가 최소인 상태에서 메모리 사용량을 크게 줄이며, 이는 추론 길이에 페널티를 부과할 때 일반적으로 보이는 성능 저하와 대조됩니다.
대체 메모리 전략과의 비교
ABBEL은 다음과 같은 여러 가지 방식으로 다른 장기 컨텍스트 관리 전략과 다릅니다:
- 컨텍스트 압축: 밀집 표현과 달리, ABBEL의 믿음 상태는 자연어이며 인간에게 이해 가능합니다.
- 수동 설계된 프롬프트/가지치기: 정적 프롬프트와 달리, ABBEL은 에이전트가 의사 결정 전략의 일부로 무엇을 기억할지 학습하도록 허용합니다.
- 외부 메모리 저장소: ABBEL은 RAG 스타일의 외부 메모리와 보완적이며, 이후에 쿼리되는 컨텍스트의 생성을 개선할 수 있습니다.
AI 메모리의 미래 방향
BAIR은 명시적 믿음 상태가 믿음 상태를 개선하는 행동에 보상을 주어 탐색을 안내하거나, 에이전트 간의 의사 소통을 촉진하거나, 사용자가 에이전트의 메모리를 직접 수정하여 더 나은 제어 가능성을 얻을 수 있다고 제안합니다.
미래 연구에서는 작업 메모리(컨텍스트), 단기 메모리, 장기 메모리(모델 가중치 또는 어댑터 메모리)와 같은 여러 메모리 형태를 결합하여 텍스트 alone으로 표현할 수 없는 정보나 상호작용 수명 동안 축적된 기술을 처리하는 것을 탐구할 가능성이 높습니다.