petergpt/bullshit-benchmark

BullshitBench measures whether AI models challenge nonsensical prompts instead of confidently answering them, created by Peter Gostev.

해결하는 문제

BullshitBench는 AI 모델이 질문 속 무의미한 전제를 탐지하고, 잘못된 가정에 자신감 있게 계속하지 않고 명확히 지적할 수 있는지 측정할 수 있는 방법을 제공합니다.

작동 방식

이 벤치마크는 소프트웨어, 금융, 법적, 의료, 물리학 등 다양한 분야에서 13가지 무의미한 기법을 포함한 질문 세트를 사용합니다. 세 명의 LLM( Claude Sonnet 4.6, GPT-5.2, Gemini 3.1 Pro Preview)으로 구성된 3인 심사판이 모델의 응답을 평가합니다. 응답은 "명확한 반박"(깨진 전제 거부), "부분적 도전"(문제를 지적하지만 여전히 참여), "무의미한 내용 수용"(전제를 유효하다고 간주)으로 분류됩니다.

대상 사용자

프롬프트 내에서 환상적이거나 유효하지 않은 가정에 대해 LLM의 견고성을 평가하고자 하는 연구자 및 개발자에게 적합합니다.

주요 특징

  • 다양한 도메인 커버리지: 소프트웨어, 금융, 법적, 의료, 물리학 분야에서 무의미한 기법 테스트.
  • 자동 평가: 세 개의 고성능 LLM으로 구성된 심사판을 통해 채점 일관성 보장.
  • 인터랙티브 대시보드: 연구소, 추론 방식, 도메인별로 필터링하여 모델 응답 비교 가능.
  • 로컬 실행: 제공된 구성 파일과 기술 가이드를 사용해 사용자가 자체 평가 실행 가능.

관련

  • 프로젝트
  • Dispatch
  • Dispatch
  • 프로젝트
  • Dispatch