petergpt/bullshit-benchmark

BullshitBench measures whether AI models challenge nonsensical prompts instead of confidently answering them, created by Peter Gostev.

解決的問題

BullshitBench 提供了一種衡量 AI 模型能否識別問題中的無意義前提,並明確指出這些前提,而不是自信地繼續基於無效假設進行推理的方法。

工作原理

該基準測試使用一組包含 13 種無意義技巧的問題,涵蓋軟體、金融、法律、醫療和物理等領域。由三名 LLM(Claude Sonnet 4.6、GPT-5.2 和 Gemini 3.1 Pro Preview)組成的評審小組對模型輸出進行評估。回應被分為三類:"明確反駁"(拒絕錯誤前提)、"部分質疑"(指出問題但仍參與對話)和"接受無意義內容"(將前提視為有效)。

適用對象

專為希望評估 LLM 在面對提示中幻覺或無效假設時韌性的研究人員和開發者設計。

主要亮點

  • 多領域覆蓋:在軟體、金融、法律、醫療和物理等領域測試無意義技巧。
  • 自動評分:使用三個高性能 LLM 組成的評審小組,確保評分一致性。
  • 互動式儀表板:提供可按實驗室、推理方式或領域過濾的檢視器,用於比較模型答案。
  • 本地執行:支援使用者使用提供的設定檔與技術指南自行執行評估。

相關

  • 專案
  • Dispatch
  • Dispatch
  • 專案
  • Dispatch