Hugging Face 排行榜模板:实现 Vectara HHEM 排行榜
TL;DR
Hugging Face 已发布开源排行榜模板,帮助开发者为大语言模型(LLM)创建轻量、动态的评估榜单。Vectara 利用这些模板推出了 Hughes 幻觉评估模型(HHEM)排行榜,提供了一种标准化方式来衡量并比较开源和商业 LLM 的幻觉率。
Hughes 幻觉评估模型(HHEM)
HHEM 是一个开源分类模型,旨在评估文档摘要中出现的幻觉——即与源内容不符或毫无意义的文本——的频率,专注于由 LLM 生成的摘要。该模型评估范围广泛,包括 GPT-4、Google Gemini、Anthropic Claude 等商业模型,以及 Llama 2、Mistral 7B 等开源模型。
通过开源 HHEM,Vectara 旨在让 LLM 幻觉评估更加民主化,并提升社区对不同模型幻觉倾向的认知。HHEM 的命名是为了纪念幻觉研究先驱 Simon Hughes。
使用 HF 模板实现 HHEM 排行榜
Vectara 通过使用 Hugging Face 排行榜模板,将原先的静态 GitHub 仓库迁移到动态的 Hugging Face Space。该框架能够管理模型提交请求并自动更新结果。
基础设置
对于标准排行榜,实现步骤包括:
- 克隆 Space 仓库 到指定组织。
- 创建两个关联数据集:一个 “requests” 数据集用于跟踪用户提交的新 LLM 评估请求,另一个 “results” 数据集用于存放最终评估指标。
- 向 results 数据集填充初始数据,并更新 “About” 与 “Citations” 部分。
HHEM 的高级定制
由于 HHEM 的评估过程比单纯的结果推送更为复杂,Vectara 在多个关键后端文件中定制了源码:
leaderboard/src/backend/model_operations.py:实现SummaryGenerator(从私有评估数据集生成摘要并计算答案率和平均摘要长度)和EvaluationModel(使用 HHEM 模型计算事实一致性率和幻觉率)。leaderboard/src/backend/evaluate_model.py:定义Evaluator类,协调SummaryGenerator与EvaluationModel生成 JSON 格式的结果。leaderboard/src/backend/run_eval_suite.py:包含run_evaluation函数,将最终计算的结果上传至 results 数据集,以在排行榜上展示。leaderboard/main_backend.py:管理待评估请求队列并执行自动评估,同时提供用户复现已有结果的选项。
对 LLM 社区的意义
这些开源模板的出现降低了创建专用 LLM 排行榜的门槛。通过提供一个处理提交与更新流水线的框架,Hugging Face 使社区能够从静态基准转向动态、社区驱动的评估系统,实时追踪新模型发布后的性能表现。