OpenAI SimpleQA 벤치마크 릴리스
TL;DR
OpenAI는 최첨단 언어 모델의 사실 정확도와 캘리브레이션을 평가하고 비교하기 위해 설계된 4,326개의 짧은 사실 탐색 질문으로 구성된 오픈소스 사실성 벤치마크인 SimpleQA를 공개했습니다.
SimpleQA란?
SimpleQA는 단일 검증 가능한 답변을 갖는 짧은 질의에 초점을 맞춘 사실성 벤치마크입니다. 간결한 사실 탐색 질문으로 범위를 제한함으로써 모델의 응답이 정확한지, 부정확한지, 혹은 시도되지 않았는지를 측정하기 쉬워집니다. 이 데이터셋은 과학, 기술, TV 프로그램, 비디오 게임 등 다양한 주제를 아우르는 4,326개의 질문을 포함하고 있어 최신 모델에게 다양성과 난이도를 동시에 제공합니다.
데이터셋 구축 및 품질 보증
- 높은 정확도 – 두 명의 독립 AI 트레이너가 출처가 포함된 정답을 생성했으며, 세 번째 트레이너가 무작위 1,000문제 샘플을 검증하여 94.4% 일치를 달성했습니다. 수동 검토 결과 약 3% 정도의 내재된 오류율이 추정됩니다.
- 다양성 – 주제가 여러 분야에 걸쳐 있으며, 원본 게시물의 파이 차트 분포로 보여집니다.
- 최첨단 난이도 – TriviaQA(2017)와 Natural Questions(2019)와 같은 벤치마크는 포화 상태이며, SimpleQA는 여전히 도전적이며 GPT‑4o의 점수는 40% 이하입니다.
- 연구자 UX – 질문과 답변이 간결하여 OpenAI API 또는 기타 모델 API를 통한 빠른 평가가 가능합니다. 적당한 규모 덕분에 실행 간 변동성이 낮습니다.
채점 방법론
SimpleQA는 모델이 예측한 답변과 정답을 모두 입력받는 프롬프트 기반 ChatGPT 분류기를 사용합니다. 분류기는 다음 세 가지 등급 중 하나를 부여합니다.
| 등급 | 정의 | 예시 (질문: 2022년 네덜란드 vs 아르헨티나 월드컵 경기에서 오픈플레이 골을 넣은 네덜란드 선수는 누구인가?; 답변: Wout Weghorst) |
|---|---|---|
| 정답 | 예측 답변이 모순 없이 정답을 완전히 포함한다. | "Wout Weghorst"; "Wout Weghorst는 83분과 90+11분에 득점했다" |
| 부정확 | 예측 답변이 어떤 방식으로든 정답과 모순된다, 설사 완화된 표현이라도. | "Virgil van Dijk"; "Virgil van Dijk와 Wout Weghorst"; "Wout Weghorst와 나는 van Dijk가 득점한 것 같지만, 확신할 수 없다" |
| 시도 안 함 | 답변이 목표 사실을 제공하지 않으며 모순도 없다. | "답을 모른다"; "직접 인터넷을 검색해 보세요" |
모델은 부정확한 답변을 최소화하면서 정답을 최대화해야 하며, “시도 안 함” 응답은 허위 생성보다 바람직합니다.
SimpleQA 모델 비교
위 채점 방식을 사용해 OpenAI는 브라우징 없이 여러 모델을 평가했습니다.
- GPT‑4o‑mini와 o1‑mini는 GPT‑4o와 o1‑preview보다 정답을 적게 맞혔으며, 이는 작은 모델이 세계 지식이 부족함을 반영합니다.
- o1‑mini와 o1‑preview는 “시도 안 함”을 더 자주 선택했으며, 이는 불확실성을 인식하고 허위 출력을 피하려는 경향을 보여줍니다.
이러한 패턴은 규모가 크거나 추론 능력이 높은 모델이 더 높은 사실 정확도를 보인다는 기대와 일치합니다.
캘리브레이션 측정
SimpleQA는 또한 캘리브레이션—모델의 신뢰도가 실제 정확도와 일치하는지를 평가하는 데 사용됩니다.
명시된 신뢰도 캘리브레이션
모델에게 각 답변과 함께 신뢰도 퍼센트를 제시하도록 요청했습니다. 신뢰도와 관측된 정확도를 플롯한 결과 양의 상관관계가 나타났으며, 모델이 어느 정도 신뢰 개념을 가지고 있음을 확인했습니다. 그러나 모든 모델이 이상적인 y = x 선 아래에 위치해 체계적인 과신을 보였습니다. 특히 o1‑preview가 o1‑mini보다, GPT‑4o가 GPT‑4o‑mini보다 캘리브레이션이 더 우수했으며, 이는 규모가 큰 모델이 일반적으로 더 잘 캘리브레이션된다는 기존 연구 결과와 일치합니다.
빈도 기반 캘리브레이션
각 질문을 100번 반복해 답변 일관성을 측정했습니다. 동일 문자열을 그룹화한 결과, 응답 빈도가 높을수록 모든 모델에서 정확도가 높아지는 경향을 보였습니다. o1‑preview가 빈도와 정확도 간 가장 강한 정렬을 보여 주었으며, 이는 작은 모델 및 GPT‑4o‑mini보다 다시 한 번 우수함을 나타냅니다.
제한 사항 및 향후 작업
SimpleQA의 범위는 의도적으로 좁습니다: 짧고 단일 답변 질의에 대해서만 사실성을 평가합니다. SimpleQA 성능이 더 길고 다중 사실을 포함하는 생성물의 사실 신뢰성을 예측할 수 있는지는 아직 미지수입니다. 보다 풍부한 답변 형식을 포괄하도록 벤치마크를 확장하는 것이 모델의 진실성을 완전히 이해하는 데 필요합니다.
영향 및 행동 촉구
SimpleQA를 오픈소스로 공개함으로써(github.com/openai/simple-evals), OpenAI는 연구 커뮤니티가 사실성 평가를 벤치마크하고 개선하며 피드백을 제공하도록 초대합니다. 보다 넓은 채택은 더 신뢰할 수 있는 언어 모델 개발을 가속화하고 캘리브레이션을 고려한 학습 방법을 안내할 수 있습니다.
Authors: Jason Wei, Karina Nguyen, Hyung Won Chung, Joy Jiao, Spencer Papay, Mia Glaese, John Schulman, Liam Fedus
Sources
- OriginalIntroducing SimpleQA