petergpt/bullshit-benchmark

BullshitBench measures whether AI models challenge nonsensical prompts instead of confidently answering them, created by Peter Gostev.

解决的问题

BullshitBench 提供了一种衡量 AI 模型能否识别问题中的无意义前提,并明确指出这些前提,而不是自信地继续基于无效假设进行推理的方法。

工作原理

该基准测试使用一组包含 13 种无意义技巧的问题,覆盖软件、金融、法律、医疗和物理等领域。由三名 LLM(Claude Sonnet 4.6、GPT-5.2 和 Gemini 3.1 Pro Preview)组成的评审小组对模型输出进行评估。响应被分为三类:"明确反驳"(拒绝错误前提)、"部分质疑"(指出问题但仍参与对话)和"接受无意义内容"(将前提视为有效)。

适用对象

专为希望评估 LLM 在面对提示中幻觉或无效假设时鲁棒性的研究人员和开发者设计。

主要亮点

  • 多领域覆盖:在软件、金融、法律、医疗和物理等领域测试无意义技巧。
  • 自动评分:使用三个高性能 LLM 组成的评审小组,确保评分一致性。
  • 交互式仪表板:提供可按实验室、推理方式或领域过滤的查看器,用于比较模型答案。
  • 本地执行:支持用户使用提供的配置文件和技术指南自行运行评估。

相关

  • 项目
  • Dispatch
  • Dispatch
  • 项目
  • Dispatch