LLM 평가에서 '확장된 시간 지평' 이해하기

대형 언어 모델(LLM)과 AI 에이전트에 대한 논의는 종종 단순한 성능 지표와 혼동될 수 있는 용어들로 가득합니다. 가장 논쟁이 되는 주제 중 하나는 "확장된 시간 지평"이라는 개념입니다. 처음 접하는 사람에게는 이것이 느린 처리에 대한 찬사나 비효율성의 지표처럼 보일 수 있습니다. 그러나 AI 에이전트 워크플로우의 복잡성은 우리가 지능과 능력을 측정하는 방식을 근본적으로 바꾸는 변화를 의미합니다.

오해: 처리 속도 vs. 작업 지평

많은 비평가들은 모델이 질문에 답하는 데 더 오래 걸린다고 찬양하는 것이 직관에 반한다고 주장합니다. 사람에게 "2 + 2"를 푸는 데 오랜 시간이 걸린다고 하면, 느린 응답 시간이 낮은 지능과 동일하다는 비유가 나오죠. 이런 관점에서는 시간 차원이 무의미합니다—모델이 컨텍스트 창을 1초에 채우든 60분에 채우든, 결과만이 중요한 것이죠.

하지만 이 비판은 근본적인 구분을 놓칩니다: 추론 속도 (초당 토큰 수)와 작업의 시간 지평 사이의 차이.

시간 지평 정의

AI 에이전트 평가에서 "시간 지평"은 AI가 결과를 계산하는 데 걸리는 시간을 의미하지 않습니다. 대신, AI가 목표를 놓치지 않고, 같은 목적에서 벗어나지 않으며, 일련의 단계에 걸쳐 "주의"가 부족해 실패하지 않고 자율적으로 처리할 수 있는 작업 규모를 의미합니다.

한 커뮤니티 멤버가 Hacker News 토론에서 언급한 바와 같이:

This is not "how long does AI take to do ${thing}", it is "how long does human take to do ${thing}, where ${thing} is from the set of things that AI has probability = n of getting right".

다시 말해, 시간 지평은 자율적인 사고 사슬의 복잡성과 길이를 나타내는 대리 지표입니다. 만약 어떤 작업이 인간 전문가에게 두 시간의 집중 작업을 요구한다면—예를 들어 복잡한 코드베이스 디버깅이나 다단계 연구 수행—그리고 AI 에이전트가 높은 성공 확률로 동일한 작업을 완료할 수 있다면, 그 AI는 "두 시간 시간 지평"을 가지고 있다고 말합니다.

왜 이것이 AI 에이전트에 중요한가

표준 LLM은 입력을 출력으로 매핑하는 무상태 함수이지만, 에이전트는 환경과 상호작용하고 피드백을 받으며 반복하는 시스템입니다. 이러한 시스템에 있어 중요한 것은 속도가 아니라 안정성입니다.

안정성 도전

LLM이 긴 행동 시퀀스 동안 목표를 유지하는 것은 다음과 같은 이유로 어렵습니다:

  1. 컨텍스트 드리프트: 에이전트가 행동을 수행하고 피드백을 받을수록 컨텍스트 창이 잡음으로 채워져 모델이 원래 목표를 잊어버릴 수 있습니다.
  2. 오류 누적: 20단계 과정의 두 번째 단계에서 작은 실수가 발생하면, 10번째 단계에 이르러 전체 실패로 이어질 수 있습니다.
  3. 재귀 루프: 에이전트가 진행이 정체된 상태를 인식하지 못하고 반복적인 행동 사이클에 빠질 수 있습니다.

연구자들이 "확장된 시간 지평"을 언급할 때, 그들은 토큰을 생성하는 속도가 아니라 긴 기간의 작업 동안 이러한 실패에 저항하는 에이전트의 능력을 찬양하는 것입니다.

결론

AI 능력 측정은 이제 표준 벤치마크의 정확도나 추론 속도만을 의미하지 않습니다. 자율 에이전트로 나아가면서, 메트릭은 복잡하고 다단계 워크플로우에서 일관성과 목표 지향성을 유지하는 능력으로 이동합니다. "시간 지평"은 소비된 CPU 사이클의 양이 아니라, AI가 신뢰할 수 있게 행사할 수 있는 자율성의 범위를 나타내는 척도입니다.

Sources