Hugging Face 社区评估
Hugging Face 已推出社区评估(Community Evals),这是一套去中心化的框架,允许基准数据集托管排行榜,模型则可自行存储评估分数。该系统旨在通过让社区通过 pull request 提交并验证结果,消除模型性能缺乏统一可信来源的问题。
去中心化的评估报告
Hugging Face 正在向 Hub 上的评估报告去中心化模型转变。系统不再依赖中心化、黑箱的排行榜,而是让社区公开报告基准分数。首次推出的基准包括四个精选基准,未来计划逐步扩展到更多相关基准。
针对基准数据集
数据集仓库现在可以注册为基准(已有 MMLU‑Pro、GPQA 和 HLE 上线)。这些仓库会自动聚合来自整个 Hub 的报告结果,并在数据集卡片中展示排行榜。为确保可复现性,基准通过基于 Inspect AI 格式的 eval.yaml 文件定义其评估规范。
针对模型仓库
评估分数以 YAML 文件形式存放在模型仓库的 .eval_results/ 目录下。这些分数会显示在模型卡片上,并被馈入基准数据集。系统会聚合模型作者提供的结果以及通过公开 pull request 提交的结果。
针对社区
任何用户都可以通过 pull request 为任意模型提交评估结果。这些结果会以 “community” 分数的形式展示,无需模型作者合并 PR。用户可以链接支持证据,例如研究论文、模型卡、第三方评估平台或 inspect 评估日志。由于 Hub 基于 Git,所有评估的新增和修改都会通过透明的历史记录进行追踪。
解决评估缺口
社区评估针对当前 AI 评估生态的两个主要缺口:
- 性能缺口: 已有文献记录了高基准分数(如 MMLU 超过 91%、GSM8K 超过 94%、HumanEval 已被“征服”)与实际任务(如网页浏览、生产代码编写、多步推理)之间的显著差距。
- 报告缺口: 模型卡、研究论文以及各种评估平台之间的分数常常不一致,导致缺乏统一的可信来源。
对 AI 生态系统的影响
通过 Hub API 暴露现有分数,社区可以更轻松地聚合和追踪全领域的性能,构建精选仪表盘和排行榜。虽然 Hugging Face 认识到该系统并不能解决基准饱和或防止在测试集上训练的问题,但它提升了对评估内容、执行方式以及评估主体的可见性。
最终目标是将 Hub 打造成一个活跃的可复现基准共享环境,特别关注能够挑战最新模型的全新任务和领域。