Google DeepMind FACTS 基准套件发布
Google DeepMind 与 Kaggle 合作发布了 FACTS 基准套件,以系统地衡量和提升大型语言模型(LLMs)的事实性。该套件提供了一个标准化框架,以识别模型在四种不同的信息检索场景中的具体失效模式:参数知识、网络搜索综合、多模态解释和基础上下文。
FACTS 基准套件组成
FACTS 基准套件由四个专门基准中的 3,513 个精选示例组成。为保持评估的完整性,Google DeepMind 使用公开集的划分以确保透明度,并使用由 Kaggle 管理的私有保留集来防止数据污染并计算最终的 FACTS 分数(所有四个基准的平均准确率)。
FACTS 参数基准
参数基准衡量模型在不使用外部工具的情况下访问其内部知识的能力。它侧重于可以使用 Wikipedia 回答的‘趣味题’式事实问题,以测试模型的内部世界知识。
- 数据集大小: 1,052 个公开条目和 1,052 个私有条目。
- 示例任务: 回答利基事实问题,例如识别 'The Rockford Files' 主题曲中的口琴演奏者。
FACTS 搜索基准
搜索基准评估模型使用网络搜索工具检索和综合信息的有效性。它专门设计为具有挑战性,通过要求顺序检索多个事实来回答单个复杂查询。
- 数据集大小: 890 个公开条目和 994 个私有条目。
- 工具: 所有模型使用相同的网络搜索工具,以确保结果反映模型能力而非检索基础设施的差异。
- 示例任务: 通过多步搜索识别的三名特定奥林匹克拳击手的出生年份之和。
FACTS 多模态基准
多模态基准测试视觉基础和参数知识的集成,要求模型基于图像输入生成事实准确的文本。
- 数据集大小: 711 个公开条目和 811 个私有条目。
- 核心要求: 模型必须准确解释视觉信息并将其与内部知识相连接,以提供完整且正确的响应。
- 示例任务: 识别图像中提供动物的属。
FACTS 基础基准 v2
这是对原始 FACTS 基础基准的更新,版本 2 测试模型提供严格基于特定提示中提供的上下文的答案的能力。
性能结果和模型基准测试
Google DeepMind 使用该套件评估了 15 个领先的 LLMs。Gemini 3 Pro 以 FACTS 分数 68.8% 实现了最高的整体性能。
Gemini 3 Pro 改进
Gemini 3 Pro 在工具使用和内部知识方面相比 Gemini 2.5 Pro 展示了显著的事实性提升:
- FACTS 搜索: 错误率降低了 55%。
- FACTS 参数: 错误率降低了 35%。
- SimpleQA 验证: 准确率从 Gemini 2.5 Pro 的 54.5% 提高到 Gemini 3 Pro 的 72.1%。
行业范围内的挑战
尽管 Gemini 3 Pro 领先,但多模态基准在所有评估模型中得分最低。没有任何模型在此类别中的总体准确率超过 70%,这表明多模态事实性仍然是未来研究和发展的重要领域。