Google DeepMind FACTS 基準套件發布

Google DeepMind 與 Kaggle 合作發布了 FACTS 基準套件,以系統地衡量並提升大型語言模型(LLM)的事實性。該套件提供了一個標準化框架,以識別在四種不同的資訊檢索情境中模型準確性的特定失敗模式:參數知識、網頁搜尋綜合、多模態解讀和基礎情境。

FACTS 基準套件組成

FACTS 基準套件由四個專門基準的 3,513 個精心策劃的範例組成。為維持評估的完整性,Google DeepMind 使用公開集的劃分來確保透明度,並使用由 Kaggle 管理的私人保留集來防止資料污染,並計算最終的 FACTS 分數(所有四個基準的平均準確率)。

FACTS 參數基準

參數基準衡量模型在不使用外部工具的情況下訪問其內部知識的能力。它專注於「雜問風格」的事實問題,這些問題可以使用 Wikipedia 回答,以測試模型的內部世界知識。

  • 資料集大小: 1,052 個公開項目和 1,052 個私人項目。
  • 範例任務: 回答冷門事實問題,例如識別《The Rockford Files》主題曲中的口琴演奏者。

FACTS 搜尋基準

搜尋基準評估模型使用網頁搜尋工具檢索並綜合資訊的效率。它專門設計為具有挑戰性,因為需要順序檢索多個事實來回答單個複雜查詢。

  • 資料集大小: 890 個公開項目和 994 個私人項目。
  • 工具: 所有模型使用相同的網頁搜尋工具,以確保結果反映模型能力,而非檢索基礎設施的差異。
  • 範例任務: 計算透過多個搜尋步驟識別出的三位特定奧運拳擊手的出生年份總和。

FACTS 多模態基準

多模態基準測試視覺基礎與參數知識的整合,要求模型根據圖像輸入生成事實準確的文本。

  • 資料集大小: 711 個公開項目和 811 個私人項目。
  • 核心需求: 模型必須準確解讀視覺資訊並將其與內部知識連結,以提供完整且正確的回應。
  • 範例任務: 識別圖像中提供動物的屬。

FACTS 基礎情境基準 v2

FACTS 基礎情境基準的原始版本的更新,版本 2 測試模型提供嚴格基於特定提示中提供的上下文的答案的能力。

效能結果與模型基準測試

Google DeepMind 使用該套件評估了 15 領先的大型語言模型。Gemini 3 Pro 以 FACTS 分數 68.8% 達成最高的整體表現。

Gemini 3 Pro 改進

Gemini 3 Pro 在工具使用和內部知識方面相較於 Gemini 2.5 Pro 展現了顯著的事實性提升:

  • FACTS 搜尋: 錯誤率降低 55%。
  • FACTS 參數: 錯誤率降低 35%。
  • SimpleQA 已驗證: 準確率從 54.5% (Gemini 2.5 Pro) 提升至 72.1% (Gemini 3 Pro)。

全產業挑戰

儘管 Gemini 3 Pro 領先,但多模態基準在所有評估模型中得到最低分數。沒有任何模型在此類別中的整體準確率超過 70%,這表明多模態事實性仍是未來研究與開發的重要領域。

Sources