TextQuests: 텍스트 기반 비디오 게임에서 LLM 에이전시 추론 평가

자율 에이전트 평가를 위한 TextQuests 벤치마크

Hugging Face는 복잡하고 탐색적인 환경에서 대형 언어 모델(LLM)이 자율 에이전트로 작동할 수 있는 능력을 평가하도록 설계된 벤치마크인 TextQuests를 소개했습니다. 최첨단 모델들이 MMLU와 GPQA와 같은 정적 지식 벤치마크를 포화시킨 반면, TextQuests는 이러한 지식이 지속적으로 확대되는 컨텍스트에서 지속적이고 자기 주도적인 추론을 요구하는 동적·인터랙티브 환경으로 전이되는지를 테스트합니다.

벤치마크 설계 및 방법론

TextQuests는 25개의 고전 Infocom 인터랙티브 픽션 게임을 활용합니다. 이 게임들은 수백 개의 정밀한 행동을 요구하고 인간 플레이어가 완료하는 데 30시간 이상이 걸릴 수 있어 엄격한 테스트베드 역할을 합니다. 벤치마크는 특히 두 가지 핵심 에이전시 능력을 측정합니다:

  • Long-Context Reasoning: 외부 도구 없이 지속적으로 증가하는 행동 및 관찰 기록을 기반으로 다단계 계획을 고안하고 실행하는 능력.
  • Learning through Exploration: 경험으로부터 학습하고, 실패를 분석하며, 시행착오를 통해 점진적인 개선을 이루는 역량.

평가 지표

모델은 두 가지 별도 실행을 통해 평가됩니다: 공식 게임 힌트에 접근할 수 있는 경우("With Clues")와 접근할 수 없는 경우("No Clues"). 각 실행은 500 단계로 제한되며, 긴 컨텍스트 성능을 테스트하기 위해 전체 게임 기록을 잘라내지 않고 유지합니다. 성능은 두 가지 주요 지표를 사용해 측정됩니다:

  1. Game Progress: 게임을 완료하는 경로에서 에이전트가 달성한 라벨이 붙은 체크포인트(필수 목표)의 수로 측정됩니다.
  2. Harm: 해로운 것으로 간주되는 특정 인게임 행동을 추적하는 윤리적 평가로, 모든 게임에 걸쳐 평균을 내어 에이전트의 전반적인 해로운 행동 경향을 판단합니다.

LLM 성능에 대한 주요 발견

긴 컨텍스트 추론 실패

컨텍스트 창이 100K 토큰을 초과하면 현재 LLM은 정밀한 추론 및 계획에서 상당한 실패를 보입니다. 일반적인 문제는 다음과 같습니다:

  • Hallucinations: 모델은 종종 이전 상호작용을 환각하여 실제로 수집하지 않은 아이템을 이미 가지고 있다고 믿습니다.
  • Repetitive Behavior: 컨텍스트가 길어질수록 에이전트는 새로운 계획을 종합하기보다 이전 행동을 반복하는 경향이 증가합니다.
  • Spatial Reasoning Deficits: 모델은 정신적 지도 작성에 어려움을 겪습니다. 예를 들어, 게임 Wishbringer에서 LLM은 상승 경로를 역으로 따라 내려가야 하는 정보를 컨텍스트 기록에 명시적으로 포함하고 있음에도 불구하고 종종 절벽을 다시 내려가는 데 실패했습니다. 마찬가지로 모든 최첨단 LLM은 Zork I의 미로 탐색에서도 어려움을 겪었습니다.

동적 사고와 효율성

벤치마크는 추론 깊이와 운영 효율성 사이의 트레이드오프를 보여줍니다. 테스트 시 더 많은 연산을 활용해(더 많은 추론 토큰을 생성) 일반적으로 높은 성능을 달성하지만, 일정 예산을 초과하면 그 이점은 감소합니다.

기본적인 탐색과 같은 많은 탐색 단계는 중간 단계이며 깊은 추론을 필요로 하지 않기 때문에, 이상적인 LLM 에이전트는 작업 복잡도에 따라 추론 노력을 동적으로 조정하여 추론 비용과 지연 시간을 최적화할 수 있는 모델입니다.

SUMMARY: Hugging Face는 25개의 고전 Infocom 인터랙티브 픽션 게임을 활용하여 LLM 에이전트의 긴 컨텍스트 추론 및 탐색 능력을 평가하는 벤치마크인 TextQuests를 소개합니다.

TITLE: TextQuests: 텍스트 기반 비디오 게임에서 LLM 에이전시 추론 평가

Sources