자기 개선 AI 에이전트 검증 방법 개요

수학 단어 문제 풀이를 위한 검증기 훈련 (OpenAI 2021)

핵심 내용은 전체 솔루션의 정확성을 예측하도록 훈련된 검증기가 반복 샘플링과 결합될 때 답변 선택을 개선할 수 있다는 점이며, 특히 검증기 훈련 세트가 커질수록 그러하다. 이 논문은 다단계 추론과 자연어 솔루션이 필요한 8,500개의 초등학생 수준 수학 문제로 구성된 GSM8K 데이터셋을 소개했습니다. 검증기를 훈련하기 위해 저자들은 GSM8K의 일부에 대해 언어 모델을 두 에포크 동안 미세 조정하고, 각 문제에 대해 100개의 완성을 생성한 후, 인간이 제공한 최종 답변을 사용하여 각 완성을 정답 또는 오답으로 라벨링하고, 이 라벨된 데이터로 한 에포크 동안 검증기를 훈련했습니다. 검증기 아키텍처는 토큰당 이진 예측을 출력하는 스칼라 헤드가 있는 언어 모델이며, 테스트 시 최종 토큰의 점수를 사용하여 완성을 순위 매기고 가장 높은 점수를 가진 것을 선택합니다. 절제 연구에 따르면 검증기가 약 1,000개 이상의 라벨된 예시를 볼 때 검증이 순수 지도 미세 조정보다 성능이 좋으며, 더 큰 생성기와 작은 검증기를 조합하는 것이 반대 조합보다 더 잘 작동하는 경향이 있음을 보여주었습니다. 문제당 완성 수를 늘리면 약 400개 샘플까지 정확도가 향상되지만, 그 이상에서는 검증기의 정밀도가 떨어집니다. 이는 étroit하게 경쟁하는 정답과 오답을 구분하지 못하기 때문입니다.

단계별로 검증하자 (OpenAI)

주요 결론은 프로세스‑슈퍼바이즈드 리워드 모델(PRMs)이 결과‑슈퍼바이즈드 리워드 모델(ORMs)보다 더 세밀한 크레딧 할당을 제공하고 환각에 더 강하다는 점이며, 특히 인간‑라벨 단계‑별 정확성이 제공될 때 그렇습니다. 저자들은 모델이 생성한 reasoning chain에 대한 800,000개의 인간‑주석 단계 라벨을 포함하는 PRM800K 데이터셋을 만들었습니다. ORM 훈련에서는 최종 토큰의 점수를 보상으로 사용했으며, PRM 훈련에서는 단계별 확률을 곱하여 시퀀스‑레벨 보상을 얻었습니다. GSM8K에서의 실험 결과 PRM이 ORM 및 다수 투표보다 우수하며, ORM이 놓치는 드문 정답 솔루션을 정확히 식별하고, PRM이 추가 라벨로부터 더 큰 이점을 얻는 것을 보여주었습니다. 프로세스 슈퍼비전은 모델이 잘못된 reasoning 경로를 통해 올바른 최종 답에 도달하여 높은 보상을 받는 것을 방지함으로써 거짓 양성을 줄입니다; 단계‑별 라벨은 이러한 바로 가기를 벌칙으로 부과합니다. 저자들은 PRM과 ORM 신호를 결합하면 두 가지의 이점을 모두 포착할 수 있다고 언급하지만, 이를 위해서는 튜닝해야 하는 임계값 하이퍼파라미터가 도입된다고 지적합니다.

Math‑Shepherd: 자동 단계‑레벨 어노테이션

핵심 결과는 각 단계가 올바른 최종 답에 도달할 잠재력을 샘플링을 통해 추정함으로써 인간 어노테이션 없이 단계‑별 라벨을 자동 생성할 수 있으며, 이 자동 생성된 PRM을 강화 학습의 리워드 모델로 사용하여 생성기를 추가로 개선할 수 있다는 점입니다. 주어진 현재 reasoning 단계에서, 방법은 N개의 연속을 샘플링합니다; 하드 추정은 어떤 연속이 올바른 최종 답에 도달하면 해당 단계를 성공으로 라벨링하며, 소프트 추정은 성공한 연속의 비율을 사용합니다. 저자들은 N = 4일 때 하드 추정과 소프트 추정의 성능이 비슷하다는 것을 발견했으며, 단순함을 위해 하드 estim을 선택했습니다. 이러한 자동 생성 라벨을 사용하여 PRM을 훈련하고 그다음 PPO를 적용하여 생성기(예: Mistral‑7B)를 PRM에 대해 미세 조정함으로써 GSM8K에서 더 높은 정확도를 달성하고, 더 도전적인 MATH 데이터셋에서는 ORM‑기반 리워드 사용보다 더 큰 향상을 얻었습니다. 이 접근법은 자기‑일관성(다수 투표) 베이스라인에서도 작동하며, 학습된 PRM이 단순한 투표‑기반 선택보다 더 강한 신호를 제공함을 보여줍니다.

Weaver: 약한 검증기의 앙상블

중심 발견은 약한‑to‑강한 감독(예: Naive Bayes 또는 로지스틱 회귀)을 통해 많은 불완전한 검증기를 결합하면 현저히 강한 검증기가 생성되며, 그 결과 앙상블을 소형 모델로 증류하여 테스트‑시간 연산을 크게 줄이면서도 대부분의 정확도를 유지할 수 있다는 점입니다. Weaver는 각 검증기(PRM, ORM, LLM 판정자 등)를 후보 솔루션에 대한 노이즈 라벨을 제공하는 것으로 간주하며, 검증기 오류가 독립적이라는 가정 하에 작은 라벨 세트에서 검증기 정확도를 추정하고 그들의 점수를 결합하기 위한 최적 가중치를 계산합니다. 저품질 검증기는 가중치 적용 전에 필터링됩니다. GPQA Diamond, MATH, MLU Pro와 같은 어려운 벤치마크에서 가중 앙상블은 8B‑파라미터 생성기의 정확도를 40% 이상에서 70% 이상으로 끌어올려 o3‑mini와 같은 훨씬 더 큰 모델의 성능과 맞먹으며, 70B 생성기로 확장하면 평균 정확도가 86.2%에 도달합니다. 가중 앙상블을 4백만‑파라미터 모델로 증류하면 앙상블의 정확도의 97%를 유지하면서 테스트‑시간 연산을 99% 이상 줄일 수 있습니다. 모든 체크포인트는 에이전트식 또는 테스트‑시간 스케일링 프로젝트에서 사용할 수 있도록 오픈소스로 공개되었습니다.

Sources