Google DeepMind FACTS 벤치마크 스위트 출시

Google DeepMind은 Kaggle과의 파트너십으로 FACTS 벤치마크 스위트를 출시하여 대규모 언어 모델(LLM)의 사실성을 체계적으로 측정하고 개선했습니다. 이 스위트는 모델 정확도의 특정 실패 모드를 식별하기 위한 표준화된 프레임워크를 제공하며, 네 가지 서로 다른 정보 검색 시나리오(파라메트릭 지식, 웹 검색 합성, 멀티모달 해석, 그라운디드 컨텍스트)를 다룹니다.

FACTS 벤치마크 스위트 구성

FACTS 벤치마크 스위트는 4개의 전문 벤치마크에 걸쳐 3,513개의 선별된 예시로 구성됩니다. 평가의 무결성을 유지하기 위해 Google DeepMind은 투명성을 위해 공개 세트를 분할하고, Kaggle이 관리하는 비공개 held-out 세트를 사용하여 데이터 오염을 방지하고 최종 FACTS 점수(모든 네 개 벤치마크의 평균 정확도)를 계산합니다.

FACTS 파라메트릭 벤치마크

파라메트릭 벤치마크는 외부 도구 없이 모델이 내부 지식에 접근하는 능력을 측정합니다. 이는 Wikipedia를 사용하여 답변할 수 있는 '트리비아 스타일' 사실 질문에 초점을 맞추어 모델의 내부 세계 지식을 테스트합니다.

  • 데이터셋 크기: 1,052개의 공개 항목과 1,052개의 비공개 항목.
  • 예제 작업: 틈새 사실 질문에 답변하기, 예를 들어 'The Rockford Files' 테마ソング의 하모니카 연주자 식별하기.

FACTS 검색 벤치마크

검색 벤치마크는 모델이 웹 검색 도구를 사용하여 정보를 얼마나 효과적으로 검색하고 합성하는지 평가합니다. 이는 단일 복잡한 쿼리에 답변하기 위해 여러 사실을 순차적으로 검색하도록 요구함으로써 의도적으로 도전적으로 설계되었습니다.

  • 데이터셋 크기: 890개의 공개 항목과 994개의 비공개 항목.
  • 도구: 모든 모델이 동일한 웹 검색 도구를 사용하여 결과가 검색 인프라의 차이보다는 모델 능력을 반영하도록 보장합니다.
  • 예제 작업: 여러 검색 단계를 통해 식별된 세 명의 특정 올림픽 복서의 출생 연도의 합을 계산하기.

FACTS 멀티모달 벤치마크

멀티모달 벤치마크는 시각적 grounding과 파라메트릭 지식의 통합을 테스트하며, 모델이 이미지 입력을 기반으로 사실적으로 정확한 텍스트를 생성하도록 요구합니다.

  • 데이터셋 크기: 711개의 공개 항목과 811개의 비공개 항목.
  • 핵심 요구 사항: 모델은 시각 정보를 정확히 해석하고 내부 지식과 연결하여 완전하고 정확한 응답을 제공해야 합니다.
  • 예제 작업: 이미지에 제공된 동물의 속을 식별하기.

FACTS 그라운딩 벤치마크 v2

원래 FACTS 그라운딩 벤치마크의 업데이트인 버전 2는 특정 프롬프트 내에 제공된 컨텍스트에 엄격히 기반한 답변을 제공하는 모델의 능력을 테스트합니다.

성능 결과 및 모델 벤치마크

Google DeepMind은 해당 스위트를 사용하여 선도적인 15개 LLM을 평가했습니다. Gemini 3 Pro는 FACTS 점수 68.8%로最高의 전체 성능을 달성했습니다.

Gemini 3 Pro 개선 사항

Gemini 3 Pro는 Gemini 2.5 Pro에 비해 특히 도구 사용 및 내부 지식 측면에서 사실성에서 상당한 향상을 보여주었습니다:

  • FACTS 검색: 오류율이 55% 감소했습니다.
  • FACTS 파라메트릭: 오류율이 35% 감소했습니다.
  • SimpleQA 검증됨: 정확도가 Gemini 2.5 Pro의 54.5%에서 Gemini 3 Pro의 72.1%로 증가했습니다.

산업 전반의 과제

Gemini 3 Pro의 선두에도 불구하고, 멀티모달 벤치마크는 모든 평가된 모델 중에서 가장 낮은 점수를 보였습니다. 이 카테고리에서 전체 정확도가 70%를 초과한 모델은 없으며, 이는 멀티모달 사실성이 미래 연구 및 개발의 중요한 분야로 남아 있음을 나타냅니다.

Sources