使用 LLM 作为评判者评估 RAG
Mistral AI 推出了一种使用“LLM 作为评判者”方法来评估检索增强生成 (RAG) 系统的方法论。该框架允许开发人员通过使用评判 LLM 根据特定的、机器可读的标准对生成 LLM 的输出进行评分,从而实现评估的规模化。
用于可扩展评估的 LLM 作为评判者
当人类评估人员无法使用时,LLM 作为评判者是进行大规模 LLM 系统评估的一种解决方案。在这种设置中,会指示“评判 LLM”使用预定义的量表对“生成 LLM”的响应进行评分,该量表可以是数值型的(例如,0-3 或 1-10)、二元型的(True/False)或定性的(例如,“Excellent”到“Bad”)。
要实现这一点,开发人员需要创建自定义指令提示词,以定义评分标准,例如响应是否准确、相关或有依据。 Mistral 的模型可以同时担任这些系统的生成器和评判者组件。
RAG 三元组评估框架
为了超越简单的连贯性检查,Mistral 推荐使用 RAG Triad,这是一个整体框架(由 TruLens 引入,类似于 RAGAS)用于评估 RAG 系统的可靠性和上下文完整性。RAG Triad 评估三个特定的指标:
1. 上下文相关性
上下文相关性衡量检索到的文档是否与用户的查询对齐。这确保了提供给生成 LLM 的信息是适当且充足的,足以产生有用的回答。
2. 根据性 (Groundedness)
根据性验证生成的响应是否准确地基于检索到的上下文。该指标对于减少幻觉至关重要,因为它能确保输出是事实性的并忠实于源数据。
3. 回答相关性
回答相关性评估最终响应在多大程度上解决了用户的原始查询,确保输出符合用户的意图并提供有价值的见解。
使用结构化输出实现评估
Mistral AI 利用其“结构化输出” API 功能,使 LLM-as-a-judge 过程更加可靠且机器可读。通过为评判者的响应强制执行特定的模式 (schema),开发人员可以确保评估结果是一致的且易于通过程序处理。
通过使用 Pydantic 模型,Mistral 展示了如何定义一个 RAGEvaluation 模式,该模式要求评判 LLM 同时提供逐步推理的解释以及针对三元组指标(上下文相关性、回答相关性以及根据性)中每一个指标的分数。
结论
将 RAG Triad 框架与结构化输出相结合,可以实现对 RAG 系统进行稳健的、端到端的评估。这种方法评估了检索和生成这两个步骤,确保人类、AI 与知识库之间的最终交互是准确且值得信赖的。
Sources
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目