petergpt/bullshit-benchmark
BullshitBench measures whether AI models challenge nonsensical prompts instead of confidently answering them, created by Peter Gostev.
何を解決するか
BullshitBench は、AI モデルが質問内の無意味な前提を検出し、明確に指摘する能力を測定する方法を提供します。無意味な仮定に自信を持って従うのではなく、そのような前提を拒否するかどうかを評価します。
動作方法
このベンチマークは、ソフトウェア、金融、法務、医学、物理学などの分野にまたがる13種類の無意味な技法を含む質問セットを使用しています。3人のLLM(Claude Sonnet 4.6、GPT-5.2、Gemini 3.1 Pro Preview)からなる審査パネルがモデルの回答を評価します。回答は「明確な反論」(破綻した前提を拒否)、「部分的な反論」(問題を指摘しながらも対話に参加)、「無意味な前提を受け入れた」(前提を有効とみなす)の3つに分類されます。
対象ユーザー
プロンプト内の幻覚的または無効な仮定に対するLLMの堅牢性を評価したい研究者や開発者向けに設計されています。
特徴
- 多分野カバー:ソフトウェア、金融、法務、医学、物理学における無意味な技法をテスト。
- 自動採点:3つの高性能LLMによるパネルを用いて採点の一貫性を確保。
- インタラクティブダッシュボード:ラボ、推論、分野ごとにフィルタリングし、モデルの回答を比較できるビューアを搭載。
- ローカル実行:提供された構成ファイルと技術ガイドを使用して、ユーザー自身で評価を実行可能。
関連
- プロジェクト
- Dispatch
- Dispatch
- プロジェクト
- Dispatch