허깅 페이스 Open LLM Leaderboard 업데이트: Math-Verify 통합으로 수학 평가 개선

허깅 페이스는 Open LLM Leaderboard에 Math-Verify 파서를 통합하여 수학 작업에서 모델 성능을 과소평가하던 체계적인 파싱 오류를 해결했습니다. 이 업데이트는 3,751개 모델에 대한 포괄적인 재평가를 포함하며, 이로 인해 MATH-Hard 리더보드 순위에 큰 변화가 생겼습니다.

왜 이전 수학 평가가 잘못되었는가

Open LLM Leaderboard의 MATH-Hard 작업은 헨드릭스 MATH 데이터셋에서 대수, 미적분 예비, 수론 등 7개 주제의 고난이도(레벨 5) 문제 1,324개를 대상으로 모델을 평가합니다. 이전에 평가 파이프라인은 엄격한 답변 형식과 SymPy 파싱에 의존했으며, 이로 인해 세 가지 주요 실패 지점 때문에 정답이 오답으로 처리되었습니다.

1. 형식 엄격성

"Final answer is [ANSWER]. I hope it is correct" 라는 정확한 문자열로 응답을 마치지 못한 모델은 수학적 결과가 맞더라도 오답으로 처리되었습니다. Math-Verify는 이 rigid formatting에 대한 의존성을 제거합니다.

2. 추출 및 파싱 실패

이전 시스템은 일반적인 LaTeX 테두리나 특정 수학 구조에서 답변을 추출하는 데 어려움을 겪었습니다. 실패 사례에는 다음이 포함됩니다:

  • LaTeX 테두리: oxed{} 표기법으로 감싼 답변(DeepSeek 모델에서 흔함)은 추출되지 않았습니다.
  • 복잡한 구조: 행렬, 구간(예: (-oo, -14)), 매개변수 방정식 등은 종종 잘못 파싱되거나 완전히 실패했습니다.
  • 잘못된 기호: 간단한 퍼센트 기호(예: "100%))도 추출 실패를 일으켰습니다.

3. 등가 비교 문제

추출된 답변이라도 시스템은 두 수학적으로 동등한 표현이 같은지 판단할 수 없었습니다. 다음과 같은 경우를 인식하지 못했습니다:

  • 수치적 등가: 예를 들어 1/3은 반올림 지원 부족으로 인해 0.333333과 동일하다고 인식되지 않았습니다.
  • 상징적 등가: sqrt(1/2)*7sqrt(0.5)*7 같은 표현은 서로 다른 것으로 표시되었습니다.
  • 고급 유형: 행렬 등가 및 집합 비교(예: {1} \cup {1,4}{1,4})에 대한 지원이 부족했습니다.

모델 성능 및 순위에 미치는 영향

Math-Verify로의 전환은 모든 모델에서 평균 4.66점의 점수 상승을 가져왔으며, 모델은 평균적으로 61개 더 많은 문제를 정확히 풀게 되었습니다.

주제별 향상

가장 큰 향상은 대수 관련 하위 집합에서 나타났습니다:

  • 대수: 8.27점 증가.
  • 예비 대수: 6.93점 증가.

이러한 향상은 Math-Verify가 집합과 행렬을 처리하는 능력이 향상되었기 때문이며, 이 주제에서 자주 등장합니다.

모델 가족 변화

특정 모델 가족은 이전에 penalize되던 출력 스타일 때문에 점수가 크게 상승했습니다:

  • DeepSeek: 파서가 이제 oxed{} 표기법을 올바르게 처리하므로 점수가 거의 세 배로 증가했습니다.
  • Qwen: 점수가 두 배 이상 증가하여 이전의 심각한 성능 과소평가를 수정했습니다.

리더보드 재편성

MATH-Hard Top 20 순위가 완전히 개편되었습니다. 엔비디아의 AceMath 모델들이 리더보드를 지배하고 있으며, 그 뒤를 Qwen 파생 모델들이 바짝 따르고 있습니다. 전반적인 리더보드 상위 4위 positions는 변하지 않았지만, 많은 모델들이 수학 점수 향상으로 인해 전체 순위에서 200위 이상 상승했습니다.

결론

Math-Verify의 채택은 Open LLM Leaderboard가 모델의 실제 수학 능력을 반영하도록 하여 특정 문자열 형식을 따르는 능력보다는 실제 능력을 평가하도록 합니다. 허깅 페이스는 연구자와 개발자가 자체 내부 평가에서도 Math-Verify를 사용하여 더 신뢰할 수 있는 결과를 얻기를 권장합니다.

Sources