petergpt/bullshit-benchmark
BullshitBench measures whether AI models challenge nonsensical prompts instead of confidently answering them, created by Peter Gostev.
解决的问题
BullshitBench 提供了一种衡量 AI 模型能否识别问题中的无意义前提,并明确指出这些前提,而不是自信地继续基于无效假设进行推理的方法。
工作原理
该基准测试使用一组包含 13 种无意义技巧的问题,覆盖软件、金融、法律、医疗和物理等领域。由三名 LLM(Claude Sonnet 4.6、GPT-5.2 和 Gemini 3.1 Pro Preview)组成的评审小组对模型输出进行评估。响应被分为三类:"明确反驳"(拒绝错误前提)、"部分质疑"(指出问题但仍参与对话)和"接受无意义内容"(将前提视为有效)。
适用对象
专为希望评估 LLM 在面对提示中幻觉或无效假设时鲁棒性的研究人员和开发者设计。
主要亮点
- 多领域覆盖:在软件、金融、法律、医疗和物理等领域测试无意义技巧。
- 自动评分:使用三个高性能 LLM 组成的评审小组,确保评分一致性。
- 交互式仪表板:提供可按实验室、推理方式或领域过滤的查看器,用于比较模型答案。
- 本地执行:支持用户使用提供的配置文件和技术指南自行运行评估。
相关
- 项目
- Dispatch
- Dispatch
- 项目
- Dispatch