企业场景排行榜:评估大型语言模型在真实业务场景中的表现
Patronus 团队与 Hugging Face 合作,推出了企业场景排行榜。该基准旨在评估大型语言模型(LLM)在实际真实的企业使用场景中的表现,而非受限的学术任务。
填补企业 LLM 评估的空白
现有的 LLM 基准主要依赖学术数据集,Patronus 团队指出这些数据集在受限环境下有用,但往往与实际业务需求差距甚大。企业场景排行榜基于与使用 LLM 的公司在多种真实场景下的交流而开发,为用户在业务应用中选择模型提供更实用的起点。
为防止对排行榜进行“投机取巧”(即模型在测试集上进行微调),团队将六个数据集中的四个保持为闭源。虽然 FinanceBench 和 Legal Confidentiality 仍为开源,但其余四个任务仅提供验证集,以帮助用户了解任务要求,同时不公开完整的测试数据。
支持的企业任务与评估指标
排行榜对模型在六个多样化任务上的表现进行评估,每个任务使用特定指标来衡量性能:
1. FinanceBench
该任务衡量模型利用文档检索上下文回答金融问题的能力。共包含 150 条提示。
- Evaluation Metric: 正确性,通过使用 GPT-3.5 的 few-shot 提示来验证生成的答案是否与自由文本标签匹配。
2. Legal Confidentiality
使用 LegalBench 中的 100 条标记提示子集,该任务衡量 LLM 对法律原因进行推理的能力。模型需以简单的“是”或“否”作答。
- Evaluation Metric: 准确率,通过生成输出与标签的完全匹配来衡量。
3. Creative Writing
该任务使用来自 r/WritingPrompts Reddit 社区以及红队生成的 100 条提示,评估故事写作和创意能力。
- Evaluation Metrics: 连贯性和吸引力,后者通过在 80k Reddit 互动数据集上训练的 EnDEX 模型进行衡量。
4. Customer Support Dialogue
该任务使用 100 条提示,测试模型基于提供的产品信息和对话历史回答客户支持问题的能力。
- Evaluation Metrics: 互动性、连贯性和对话深度。如果回复未直接回答问题、信息不完整或忽略历史中提及的产品,则被标记为无关;这些通过使用 GPT-3.5 的 few-shot 提示进行评估。
5. Toxicity
为评估安全性,使用 100 条通过红队创建的提示,尝试诱导模型输出有害信息。
- Evaluation Metric: 有毒性评分,使用 Perspective API 检测粗鲁、不尊重或不合理的评论。
6. Enterprise PII
该任务使用 EnterprisePII 数据集中的 100 条提示,评估模型是否会泄露业务敏感信息,如员工绩效报告,以此衡量业务安全性。
- Evaluation Metric: EnterprisePII 分类器,该模型在 3,000 条企业 PII 标记示例上训练。任何生成业务敏感信息的输出均视为失败。
Submission and Validation
提交到排行榜的模型必须是公开的,并可通过 Hugging Face AutoClasses 加载。虽然评估代码未开源,但模型生成结果和在验证集上的评估可通过 PatronusAI validation-results 数据集获取。