OpenAI SimpleQA 基準發布

TL;DR

OpenAI 發布了 SimpleQA,一個開源的事實性基準,包含 4,326 個短小、尋求事實的問題,旨在評估與比較前沿語言模型的事實準確性與校準程度。

SimpleQA 是什麼?

SimpleQA 是一個聚焦於單一可驗證答案的短查詢事實性基準。透過限制範圍於簡潔的事實查詢,該基準使得衡量模型回應是正確、錯誤或未嘗試變得可行。資料集包含 4,326 個問題,涵蓋科學、技術、電視節目、電玩等廣泛主題,確保對最先進模型既具多樣性亦具挑戰性。

資料集建構與品質保證

  • 高正確性 – 兩位獨立的 AI 訓練師產生了有來源支持的參考答案;第三位訓練師驗證了隨機抽取的 1,000 題樣本,達成 94.4% 的一致性。人工檢查顯示固有錯誤率約為 3%。
  • 多樣性 – 主題涵蓋多個領域,原帖中以餅圖分布說明。
  • 前沿難度 – 如 TriviaQA(2017)和 Natural Questions(2019)等基準已趨於飽和;SimpleQA 仍具挑戰性,GPT‑4o 的得分低於 40%。
  • 研究者使用體驗 – 問題與答案簡潔,能透過 OpenAI API 或其他模型 API 快速評估。適中的規模使得多次執行的變異性低。

評分方法

SimpleQA 使用一個提示式 ChatGPT 分類器,接收模型的預測答案與真實答案。分類器會給予三種等級之一:

等級 定義 範例(問題:哪位荷蘭球員在 2022 年荷蘭對阿根廷的世界杯比賽中取得了開放式進球?;答案:Wout Weghorst
正確 預測答案完整包含真實答案且沒有矛盾。 "Wout Weghorst"; "Wout Weghorst scored at 83’ and 90+11’"
不正確 預測答案以任何方式與真實答案相矛盾,即使語氣含糊。 "Virgil van Dijk"; "Virgil van Dijk and Wout Weghorst"; "Wout Weghorst and I think van Dijk scored, but I am not totally sure"
未嘗試 答案未提供目標事實且沒有矛盾。 "I don’t know the answer"; "Please browse the internet yourself"

模型應盡可能最大化正確答案,同時最小化不正確答案;「未嘗試」的回應比幻覺更可取。

SimpleQA 上的模型比較

使用上述評分方案,OpenAI 評估了多個未使用瀏覽功能的模型:

  • GPT‑4o‑minio1‑mini 的正確回答數少於 GPT‑4oo1‑preview,顯示較小模型的世界知識較低。
  • o1‑minio1‑preview 更常選擇「未嘗試」,顯示它們能辨識不確定性而非產生幻覺。

這些模式與預期相符:較大或更具推理強度的模型會產生更高的事實正確性。

校準測量

SimpleQA 亦用於評估校準——模型的信心是否與實際準確度相匹配。

陳述信心校準

模型在每個答案中被要求給予信心百分比。將信心與觀測到的準確率繪製圖表,顯示正相關,證實模型具備一定的信心概念。然而,所有模型皆低於理想的 y = x 線,顯示系統性過度自信。值得注意的是,o1‑preview 的校準優於 o1‑mini,且 GPT‑4o 的校準優於 GPT‑4o‑mini,呼應先前發現較大模型往往校準較佳。

基於頻率的校準

將每個問題重複 100 次以測量答案一致性。將相同字串分組後發現,較高的回應頻率對應於所有模型的較高準確率。o1‑preview 在頻率與準確率之間的對應最為強烈,再次優於其較小的對應模型以及 GPT‑4o‑mini。

限制與未來工作

SimpleQA 的範圍刻意設計得較窄:僅評估短小、單一答案查詢的事實性。SimpleQA 的表現是否能預測模型在較長、多事實生成時的事實可靠性仍是未解之謎。未來需要擴展基準以涵蓋更豐富的答案格式,才能完整了解模型的真實性。

影響與行動呼籲

透過開源 SimpleQA(請參閱 github.com/openai/simple-evals 上的 GitHub 倉庫),OpenAI 邀請研究社群對事實性評估進行基準測試、改進並提供回饋。更廣泛的採用有望加速更可信語言模型的開發,並指導具校準意識的訓練方法。


作者:Jason Wei, Karina Nguyen, Hyung Won Chung, Joy Jiao, Spencer Papay, Mia Glaese, John Schulman, Liam Fedus

SUMMARY: OpenAI 發布了 SimpleQA,一個包含 4,326 個短小事實查詢的開源基準,用於評估前沿語言模型的事實準確性與校準。

TITLE: OpenAI SimpleQA 基準發布

Sources