Qwen2.5-Math-PRM 및 ProcessBench 출시

Qwen은 두 개의 새로운 프로세스 보상 모델(PRM), Qwen2.5-Math-PRM-7BQwen2.5-Math-PRM-72B, 그리고 ProcessBench라고 불리는 새로운 평가 벤치마크를 출시했습니다. 이러한 출시는 최종 답에만 의존하는 대신 중간 추론 단계의 오류를 식별하고 완화함으로써 대형 언어 모델(LLM)의 수학적 추론 신뢰성을 향상시키는 것을 목표로 합니다.

ProcessBench: 단계 수준 평가 벤치마크

ProcessBench는 수학적 추론에서 오류가 있는 단계의 정확한 위치를 식별하는 모델의 능력을 측정하도록 설계되었습니다. 전통적인 응답 수준 평가와 달리, ProcessBench는 솔루션의 단계별 검증에 중점을 둡니다.

  • 데이터셋 구성: 벤치마크는 3,400개의 테스트 케이스로 구성되며, 주로 경시 및 올림피아드 수준의 수학에 중점을 둡니다.
  • 주석: 각 테스트 케이스에는 인간 전문가가 오류의 위치를 주석으로 표시한 단계별 솔루션이 포함됩니다.
  • 작업: 모델은 오류가 포함된 가장 이른 단계를 식별하거나 전체 솔루션이 올바르다고 올바르게 결론짓는 능력을 평가받습니다.
  • 적용 가능성: 이 벤치마크는 PRM뿐만 아니라 일반 '비판자' 모델(일반 LLM에게 솔루션을 단계별로 비판하도록 프롬프트하는 모델)을 평가하는 데 사용할 수 있습니다.

Qwen2.5-Math-PRM 모델 기능

Qwen은 Qwen2.5-Math-7B-Instruct 및 Qwen2.5-Math-72B-Instruct에 미세 조정된 두 가지 PRM 버전을 출시했습니다. 이러한 모델은 개별 추론 단계에 점수를 매겨 프로세스 감독을 제공하도록 설계되었습니다.

Best-of-N (BoN) 성능

Best-of-N 평가에서 PRM은 $N$개의 후보 중에서 가장 높은 점수를 받은 응답을 선택합니다. Qwen2.5-Math-PRM-7B의 경우, $N=8$개의 응답이 Qwen2.5-Math-7B-Instruct에서 일곱 개의 벤치마크(GSM8K, MATH, Minerva Math, GaoKao 2023 En, OlympiadBench, College Math, MMLU STEM)에서 샘플링되었습니다.

  • 성능 향상: Qwen2.5-Math-PRM-7B는 모든 일곱 작업에서 다수 투표 기준(maj@8)을 능가했으며, 평균 향상률은 1.4%였습니다.
  • 비교: Qwen2.5-Math-PRM-72B는 Qwen2.5-Math-RM-72B보다 전반적으로 더 나은 성능을 보였으며, 가장 큰 향상은 MMLU STEM 및 Minerva Math 작업에서 나타났습니다.

ProcessBench에서의 오류 식별

ProcessBench에서 테스트한 결과, PRMs는 오류가 있는 추론 단계를 식별하는 높은 능력을 보여주었습니다:

  • 경쟁적 위치: Qwen2.5-Math-PRM-7B는 다른 모든 오픈소스 모델 및 GPT-4o-0806과 같은 독점 모델을 능가했습니다.
  • 상대적 성능: Qwen2.5-Math-PRM-7B는 다른 오픈소스 PRM보다 우수하지만, o1-mini와 비교했을 때 여전히 성능 차이가 존재합니다.
  • ORM 통찰: 결과 보상 모델(ORM)인 Qwen2.5-Math-RM-72B도 단계 오류를 식별하는 데 상당한 능력을 보여주었으며, 일부 오픈소스 PRM을 넘어섰습니다.

프로세스 감독에 대한 시사점

Qwen은 응답 수준 Best-of-N 평가에만 의존하면 잠재적인 편향이 발생할 수 있음을 파악했습니다. ProcessBench를 도입함으로써 연구소는 단계 수준 평가의 격차를 메우고 PRM에 대한 현재 데이터 구축 접근 방식의 한계를 강조하려고 합니다. 이러한 모델과 벤치마크의 출시는 확장 가능한 감독과 LLM 추론 과정의 신뢰성에 대한 미래 연구를 촉진하기 위한 것입니다.

Sources