企业场景排行榜:评估大型语言模型在真实业务场景中的表现

Patronus 团队与 Hugging Face 合作,推出了企业场景排行榜。该基准旨在评估大型语言模型(LLM)在实际真实的企业使用场景中的表现,而非受限的学术任务。

填补企业 LLM 评估的空白

现有的 LLM 基准主要依赖学术数据集,Patronus 团队指出这些数据集在受限环境下有用,但往往与实际业务需求差距甚大。企业场景排行榜基于与使用 LLM 的公司在多种真实场景下的交流而开发,为用户在业务应用中选择模型提供更实用的起点。

为防止对排行榜进行“投机取巧”(即模型在测试集上进行微调),团队将六个数据集中的四个保持为闭源。虽然 FinanceBench 和 Legal Confidentiality 仍为开源,但其余四个任务仅提供验证集,以帮助用户了解任务要求,同时不公开完整的测试数据。

支持的企业任务与评估指标

排行榜对模型在六个多样化任务上的表现进行评估,每个任务使用特定指标来衡量性能:

1. FinanceBench

该任务衡量模型利用文档检索上下文回答金融问题的能力。共包含 150 条提示。

  • Evaluation Metric: 正确性,通过使用 GPT-3.5 的 few-shot 提示来验证生成的答案是否与自由文本标签匹配。

2. Legal Confidentiality

使用 LegalBench 中的 100 条标记提示子集,该任务衡量 LLM 对法律原因进行推理的能力。模型需以简单的“是”或“否”作答。

  • Evaluation Metric: 准确率,通过生成输出与标签的完全匹配来衡量。

3. Creative Writing

该任务使用来自 r/WritingPrompts Reddit 社区以及红队生成的 100 条提示,评估故事写作和创意能力。

  • Evaluation Metrics: 连贯性和吸引力,后者通过在 80k Reddit 互动数据集上训练的 EnDEX 模型进行衡量。

4. Customer Support Dialogue

该任务使用 100 条提示,测试模型基于提供的产品信息和对话历史回答客户支持问题的能力。

  • Evaluation Metrics: 互动性、连贯性和对话深度。如果回复未直接回答问题、信息不完整或忽略历史中提及的产品,则被标记为无关;这些通过使用 GPT-3.5 的 few-shot 提示进行评估。

5. Toxicity

为评估安全性,使用 100 条通过红队创建的提示,尝试诱导模型输出有害信息。

  • Evaluation Metric: 有毒性评分,使用 Perspective API 检测粗鲁、不尊重或不合理的评论。

6. Enterprise PII

该任务使用 EnterprisePII 数据集中的 100 条提示,评估模型是否会泄露业务敏感信息,如员工绩效报告,以此衡量业务安全性。

  • Evaluation Metric: EnterprisePII 分类器,该模型在 3,000 条企业 PII 标记示例上训练。任何生成业务敏感信息的输出均视为失败。

Submission and Validation

提交到排行榜的模型必须是公开的,并可通过 Hugging Face AutoClasses 加载。虽然评估代码未开源,但模型生成结果和在验证集上的评估可通过 PatronusAI validation-results 数据集获取。

Sources