Agentic 코딩 평가에서 인프라 노이즈 정량화
Anthropic는 인프라 구성만으로도 최고 성능 모델을 구분하는 데 일반적으로 사용되는 범위를 초과하는 성능 차이를 유발할 수 있음을 발견했다. 내부 실험에서 Terminal-Bench 2.0를 사용한 결과, 가장 자원이 많은 설정과 가장 적은 설정 간 성공률 격차는 6%포인트(p < 0.01)였다.
Agentic 평가의 핵심 구성 요소로서의 인프라
모델의 출력을 직접 평가하는 정적 벤치마크와 달리, Agentic 코딩 평가(SWE-bench 및 Terminal-Bench 등)는 모델이 프로그램을 작성하고, 종속성을 설치하며, 테스트를 실행할 수 있도록 완전한 런타임 환경을 제공한다. 이로 인해 런타임은 문제 해결 과정의 일부가 되며, 단순한 수용자 역할을 하지 않는다.
Anthropic는 리소스 사양(CPU 및 RAM)을 하한선과 하드한계로 모두 취급할 경우, 일시적인 피크에 대한 여유 공간이 부족해 인프라 오류율이 높아진다는 점을 관찰했다. Google Kubernetes Engine(GKE) 설정에서, 모델 능력과 무관한 포드 오류로 인해 최대 6%의 작업이 실패했다. 이는 보장된 할당량과 하드한계가 동일한 컨테이너에서 순간적인 메모리 변동이 Out-of-Memory(OOM) 종료를 유발할 수 있기 때문이다.
자원 여유 공간이 성공률에 미치는 영향
스카프홀드의 영향을 정량화하기 위해, Anthropic는 1x에서 완전히 제한 없이까지의 여섯 가지 자원 구성에서 Terminal-Bench 2.0을 테스트했다. 그 결과 자원과 점수 사이에 이단계적 관계가 있음을 보여주었다.
1. 신뢰성 단계 (1x에서 3x 여유 공간)
권장 사양의 약 3배까지 자원을 늘리면 주로 인프라 신뢰성이 향상된다. 인프라 오류율은 엄격한 제한 조건에서 5.8%에서 3x 여유 공간에서 2.1%로 단조롭게 감소했으며(p < 0.001). 이 단계에서는 성공 점수가 노이즈의 범위 내에서 변동했으며(p = 0.40), 추가 자원이 과제 해결의 난이도를 낮추기보다는 부작위적인 충돌을 해결하는 데 주로 기여했다는 것을 시사한다.
2. 능력 단계 (3x에서 제한 없음)
3x를 넘어서면 성공률은 인프라 오류 감소보다 더 빠르게 상승하기 시작했다. 3x에서 제한 없음 자원 사이에서 인프라 오류는 1.6%포인트 감소했지만, 성공률은 거의 4%포인트 상승했다. 이는 풍부한 자원이 다음과 같은 전략을 가능하게 한다는 것을 의미한다:
- 대규모 종속성 가져오기.
- 비용이 큰 하위 프로세스 생성.
- 메모리 집약적인 테스트 세트 실행.
예를 들어, bn-fit-modify 작업에서는 일부 모델이 pandas, networkx, scikit-learn을 포함한 전체 데이터 과학 스택을 설치하려는 시도를 한다. 이 전략은 풍부한 제한 조건에서는 성공하지만, 엄격한 조건에서는 실패한다. 반면, 더 간단한 전략(수학을 처음부터 구현)은 제한 조건과 무관하게 성공한다.
벤치마크 간 검증
Anthropic는 다양한 모델과 벤치마크에서 이러한 발견을 재현했다:
- 모델 일관성: 효과의 방향은 Anthropic의 다양한 모델에서 일관되게 나타났지만, 크기는 달라졌다.
- SWE-bench: 227개 문제(각각 10개 샘플)에 대한 교차 실험에서 RAM이 기준보다 5배까지 증가할수록 점수가 단조롭게 상승했다. 그러나 효과는 작았으며(1x 대비 5x에서 1.54%포인트 높음), SWE-bench 과제가 일반적으로 Terminal-Bench보다 자원 집약적이지 않기 때문일 가능성이 크다.
기타 변동 요인
RAM과 CPU 외에도, 다른 시스템 수준의 요인이 Agentic 평가에서 혼란 요인으로 작용할 수 있다:
- 시간 제한: 특정 구성에서는 에이전트가 수행할 수 있는 시간에 따라 성능이 변동한다.
- 환경 노이즈: 성공률은 하루 시간대에 따라 변동할 수 있으며, 이는 트래픽 패턴과 관련된 API 지연 변화 때문일 수 있다.
- 하드웨어 및 네트워크: 클러스터 상태, 하드웨어 사양, 동시성 수준, 이그레스 대역폭은 모두 최종 점수에 영향을 줄 수 있다.
평가의 엄격성 향상을 위한 권고
인프라 노이즈를 최소화하고 시스템의 특이성과 모델 능력을 혼동하지 않기 위해, Anthropic는 다음과 같은 권고를 제시한다:
- 이중 매개변수 명시: 평가에서는 각 작업마다 보장된 할당량(하한선)과 별도의 하드 종료 한계(상한선)를 명시해야 한다. 이는 부작위적인 OOM 종료를 방지하면서도 점수 과대평가를 막기 위한 하드한계를 유지한다.
- 밴드 조정: 하한선과 상한선 사이의 간격은 점수가 노이즈 범위 내에 머무르도록 조정되어야 한다. Terminal-Bench 2.0에서는 3x 상한선이 효과적인 균형점으로 나타났으며, 인프라 오류를 크게 줄이면서 점수 과대평가를 거의 유발하지 않았다.
- 구성 정보 공개: 자원 곱수와 강제 실행 방법은 벤치마크 결과와 함께 명시적으로 보고되어야 한다.
- 샘플링 증가: 다양한 날짜에 걸쳐 평가를 여러 번 수행하면 일시적인 노이즈를 평균화할 수 있다.
벤치마크 해석에 대한 함의
리더보드에서 작은 리드가 더 큰 VM을 의미할 수 있기 때문에, Anthropic는 리더보드 차이가 3%포인트 미만인 경우 평가 구성이 문서화되고 일치하지 않는 한 회의적으로 보아야 한다고 제안한다. Terminal-Bench에서 중간 수준의 자원 구성 간에 관측된 분포는 2%포인트 미만이며, 기존 이항 신뢰구간과 더해져 더 큰 영향을 미친다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch