Stanford CS329A 강의: 에이전트 평가 및 장기 지평 작업(Long Horizon Tasks)

METR 시간 지평 평가

METR 벤치마크는 인간 전문가와 비교하여 50% 및 80% 성공률에서의 시간 지평(time horizon)을 보고함으로써 모델이 얼마나 오랫동안 신뢰할 수 있게 작업을 완료할 수 있는지를 측정합니다.

  • 단기 작업(130초)의 경우 성공률이 높고, HCAST 작업(1분30시간)의 경우 성공률이 다양하며, RE‑Bench 작업(최대 8시간)의 경우 성공률이 낮습니다.
  • 50% 지평은 GPT‑2(2019)의 약 2초에서 Claude 3.7 Sonnet(2025)의 약 59분으로 성장했으며, 이는 약 7개월마다 두 배씩 증가하는 추세입니다.
  • 80% 신뢰도에서의 지평은 훨씬 짧습니다: Claude 3.7 Sonnet은 약 15분을 달성하며, 50%와 80% 성능 사이의 큰 격차를 보여줍니다.
  • 개선 사항은 더 나은 논리적 추론, 코드 생성, 도구 사용, 오류 복구 및 컨텍스트 엔지니어링에 의해 주도되지만, 신뢰도는 여전히 제한 요소로 남아 있습니다.

GDPVal 경제적 가치 벤치마크

GDPVal은 모델 출력이 10년 이상의 경력을 가진 업계 전문가의 작업과 비교했을 때 충분히 좋은지를 평가하며, 44개 직업군과 9개 분야에 걸쳐 승률(win rates)을 보고합니다.

  • 승률은 GPT‑4o의 12.4%에서 Claude Opus 4.1의 47.6%로 상승했으며, 이는 지난 2년 동안 대략적인 선형적 개선을 나타냅니다.
  • 작업은 잘 정의되어 있고 종종 멀티모달이며, 골드 서브셋(gold subset)에서 작업당 평균 가치는 약 $400입니다.
  • 모델은 짧고 잘 정의된 작업에서 더 나은 성능을 보이고, 더 길고 모호한 작업에서는 성능이 저하됩니다. 명시적인 컨텍스트 없이 무엇을 작업해야 할지 추론해야 할 때 어려움을 겪습니다.
  • 컨텍스트와 작업 프레이밍을 제공하는 인간의 감독은 많은 직업군에서 AI 보조를 비용 효율적으로 만듭니다.

DeepScholar‑Bench 연구 합성(Research Synthesis)

DeepScholar‑Bench는 모델이 학술 논문의 문헌 연구(literature-review) 섹션을 생성할 수 있는지 테스트하며, 지식 합성, 검색 품질, 인용 검증 가능성을 점수화합니다.

  • 현재 시스템(OpenAI deep research, Gemini deep research 등)은 이 라이브 벤치마크에서 전체적으로 19% 미만의 점수를 기록합니다.
  • 모델은 종종 일관성 있는 영어 문장을 생성하지만 핵심 사실을 놓칩니다. 검색 품질은 보통 수준이며, 문서 중요도 점수는 12.5% 미만입니다.
  • 검증 가능성은 높을 수 있습니다(예: DeepScholar base ~90% precision). 하지만 합성(synthesis)과 검증 가능성은 동시에 탁월하기 어렵습니다.
  • 실패 모드는 불완전한 소스 검색, 문서 중요도 평가 능력 부족, 핵심 사실의 비효율적인 추출, 그리고 합성 품질과 인용 정확도 사이의 트레이드오프(trade-offs)에서 기인합니다.

실패 모드 및 도전 과제

벤치마크 전반에 걸쳐 반복되는 에이전트 실패 모드는 다음과 같습니다:

  • 미흡한 계획(Poor planning): 작업을 적절한 단계로 나누지 못함.
  • 잘못된 도구 선택(Incorrect tool selection): 작업을 진전시키지 못하는 도구를 선택함.
  • 조기 포기(Premature abandonment): 반복적인 행동이나 혼란으로 인해 성공하기 전에 중단함.
  • 반복적인 행동 루프(Repetitive action loops): 실패 후 동일한 높은 확률의 행동을 것을 반복함.
  • 추가적인 도전 과제: 모델은 무엇을 작업해야 할지 알기 위해 광범위한 컨텍스트가 필요하며, 모호한 프롬프트에 어려움을 겪고, 소프트웨어 및 지식 노동 분야를 넘어선 제한된 일반화 능력을 보여줍니다.

핵심 요약(Key Takeaways)

  • 능력(시간 지평)은 기하급수적으로 향상상하고 있지만, 신뢰도(80% 지평)는 크게 뒤처져 있습니다.
  • 경제적 가치 벤치마크는 선형적 이익을 보여주며, 명시적인 컨텍스트와 인간 참여형(human-in-the-loop) 프레이밍의 중요성을 강조합니다.
  • 연구 합성 작업은 모델이 여전히 전문가 수준의 지식 검색, 핵심 사실 추출, 인용 검증을 동시에 수행할 수 없음을 보여줍니다.
  • 따라서 에이전트 AI의 발전은 더 나은 계획, 도구 사용, 오류 복구, 그리고 장기 지평 목표를 위해 필요한 컨텍스트를 제공하거나 추론할 수 있는 방법론이 필요합니다."} ,

Sources