Anthropic 모델 평가를 위한 통계적 접근법
Anthropic는 새로운 연구 논문 "평가에 오차 막대 추가하기: 언어 모델 평가를 위한 통계적 접근법"을 발표했는데, 과학적 엄격성을 갖춘 AI 모델 평가 결과를 보고하는 프레임워크를 제공한다. 핵심 목적은 모델이 벤치마크에서 우수한 성능을 보이는 것이 진정한 능력의 결과인지, 아니면 특정 질문 선택에 따른 단순한 '운'의 결과인지 판단하는 것이다.
중심극한정리로 능력 측정하기
특정 질문 세트에 의존하지 않는 본질적인 능력을 측정하기 위해 연구자들은 특정 벤치마크의 관측 평균이 아니라, 모든 가능한 질문에 대한 이론적 평균에 초점을 맞춰야 한다.
중심극한정리에 따르면, 동일한 분포에서 추출한 무작위 표본의 평균은 정규분포를 따른다. Anthropic는 모든 평가 점수와 함께 평균의 표준오차(SEM)를 보고할 것을 권장한다. 이를 통해 평균 점수에서 1.96 × SEM을 더하고 빼면 95% 신뢰구간을 계산할 수 있으며, 이는 모델의 이론적 성능에 대한 수학적으로 타당한 측정을 제공한다.
군집 표준오차로 비독립 질문 다루기
SQuAD, RACE, QuAC, DROP과 같은 인기 있는 벤치마크는 하나의 텍스트 문단 주변에 여러 질문을 묶는 방식으로 구성되어 있어, 질문 간 독립성 가정을 위반한다. 이러한 군집된 질문에 대해 단순한 중심극한정리 접근법을 적용하면 표준오차가 과소평가되며, 실제로는 존재하지 않는 능력 차이를 잘못 탐지할 수 있다.
Anthropic는 무작위화 단위(예: 텍스트 문단) 기준으로 군집 표준오차를 계산할 것을 권장한다. 실제 테스트에서 Anthropic는 인기 있는 평가에서 군집 표준오차가 단순 표준오차보다 3배 이상 큰 것을 발견했다.
질문 내 분산 줄이기 전략
점수의 무작위 성분의 분산을 줄이면 전체 평균의 통계적 정밀도가 직접적으로 향상된다. Anthropic는 프롬프팅 방법에 기반한 두 가지 주요 전략을 제안한다:
- 사고의 사슬(CoT) 추론의 경우: 연구자들은 동일한 모델에서 여러 번 답변을 재표본 추출하고, 질문 수준의 평균을 중심극한정리의 입력으로 사용해야 한다. Inspect 프레임워크는 현재
epochs매개변수를 통해 이를 구현하고 있다. - CoT 추론이 아닌 경우: 다음 토큰 확률을 사용하면 무작위 성분을 종종 제거할 수 있다. 예를 들어, 다중 선택 문제에서 "B"가 정답일 경우, 점수는 모델이 토큰 "B"에 부여하는 확률로 삼아야 하며, 이진 정답/오답 결과로 삼는 것이 아니라 한다.
쌍차이 분석을 통한 신호 향상
두 모델을 두 표본 t-검정으로 비교할 경우 데이터의 공통 구조를 무시하게 된다. 모델들은 동일한 질문 목록에서 테스트되기 때문에, 질문 난이도로 인한 분산을 제거하고 응답의 분산에만 초점을 맞추는 쌍차이 검정이 더 효과적이다.
Anthropic는 선도 모델들 사이에 질문 점수 간 상당한 상관관계(0.3에서 0.7 사이)가 있음을 지적한다. 즉, 모델들은 같은 질문을 맞추거나 틀리는 경향이 있다. 평균 차이, 표준오차, 신뢰구간, 상관관계를 보고하면 상대적 성능에 대한 더 명확한 신호를 얻을 수 있다.
평가 설계를 위한 검정력 분석 사용하기
통계적 검정력은 실제로 존재하는 두 모델 간 차이를 탐지할 수 있는 테스트의 능력을 의미한다. 충분한 검정력이 없으면, 실제 존재하는 작은 능력 차이도 탐지되지 않을 수 있다.
Anthropic는 다음과 같은 절차를 통해 검정력 분석을 사용할 것을 권장한다:
- 구체적인 가설 설정 (예: "모델 A는 모델 B보다 3% 더 우수하다")
- 귀무가설(예: "모델 A와 모델 B는 동점이다")에 대해 그 가설을 검증하기 위해 필요한 질문 수 계산
- 원하는 검정력 특성을 유지하기 위해 필요한 답변 재표본 수 결정
- 예상 효과 크기를 기반으로 제한된 질문 수로 평가를 수행할 가치가 있는지 판단
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch