Hugging Face 在 Hub 上的评估
Hugging Face 已推出 Evaluation on the Hub,这是一款由 AutoTrain 提供动力的无代码工具,使用户能够在 Hugging Face 生态系统内直接对任意模型、任意数据集使用任意指标进行评估。该工具通过消除手动评估的技术障碍并提升报告结果的可复现性,解决了现代 AI 中的“评估危机”。
在 Hub 上标准化模型评估
Evaluation on the Hub 通过将评估直接集成到 Hub 的基础设施中,简化了模型性能测量的过程。与依赖自行报告的结果不同,这些结果可能受到实现差异或 bug 的影响,该工具能够将经过验证的性能指标直接写入模型卡的元数据中。
关键功能包括:
- Finding Optimal Models:用户可以访问特定数据集的排行榜,以识别表现最佳的模型,或对尚未列出的新模型进行评估。
- Baseline Establishment:用户可以将新数据集上传至 Hub,并在多个模型上运行基线评估,无需编写代码。
- Cross-Dataset Validation:模型开发者可以在众多相关数据集上评估同一模型,以检验其泛化能力。
技术集成与工作流
Evaluation on the Hub 通过 Spaces 与 AutoTrain 的组合,集成到现有的 Hugging Face 生态系统中。工作流通常从数据集页面开始,随后跳转至 model-evaluator Space。
配置评估任务
虽然许多数据集已包含可实现一键评估的元数据,用户仍可通过 Advanced configuration 手动配置任务,具体包括:
- Task and Split Selection:定义要使用的具体机器学习任务、数据集以及数据划分。
- Dataset Mapping:将数据集列映射到标准格式(例如,指定哪些列包含图像,哪些列包含标签)。
- Metric Selection:从任务默认的指标(如准确率或 F1 分数)中选择,或选用专门的指标,例如 Matthew's correlation coefficient。
执行与结果
用户选择待评估的模型并提交任务后,后端(由 AutoTrain 提供动力)会自动执行评估。评估结果随后通过 Pull Request (PR) 提交回 Hub,写入模型的模型卡,确保性能数据透明且已验证。用户还可以将评估元数据复制到数据集卡中,以便社区后续评估更加便捷。
应对 AI 评估危机
Hugging Face 将 Evaluation on the Hub 定位为对 AI 基准测试系统性问题的回应。公司指出,尽管硬件和算法发展迅速,评估方法却停滞不前,导致以下关键问题:
- Benchmark Saturation:模型在某些测试集上超越人类的速度快于新基准的产生速度。
- Brittleness and Bias:高排行榜分数常掩盖底层的恶意偏见或系统脆弱性。
- Lack of Reproducibility:缺乏开放性和标准化实现,使得复现报告结果变得困难。
- Deployment Overlooked:实际关注点如效率和公平性常被原始准确率指标所忽视。
未来路线图
Evaluation on the Hub 基于 Hugging Face evaluate 库以及现有的 RAFT、GEM 基准。Hugging Face 计划将该工具扩展至更多任务,并集成全新改进的数据测量工具,以迈向更整体、可信且可复现的评估范式。
Sources
- OriginalAnnouncing Evaluation on the Hub