Hugging Face 零样本评估在 Hub 上

Hugging Face 已通过 “Evaluation on the Hub” 工具为因果语言模型启用了零样本评估。此更新使研究人员和开发者能够在分类任务上衡量模型性能,而无需标记的训练数据或自定义 GPU 基础设施,从而实现对超大语言模型(LLM)基准测试的民主化访问。

零样本评估基础设施

Evaluation on the Hub 在 AutoTrain 的支持下,现在支持对托管在 Hub 上的任何因果语言模型进行零样本分类。该系统消除了评估大规模模型的技术和财务障碍,例如加载和编译拥有数百亿参数的模型所需的大量时间和硬件成本。

基础设施的关键技术细节包括:

  • 模型容量: 该工具目前支持最高 660 亿参数的模型,未来计划支持更大的模型。
  • 性能: 在零样本分类任务中,对 660 亿参数模型使用 2,000 条句子长度的示例进行评估,大约需要 3.5 小时。
  • 机制: 零样本文本分类任务的工作原理是将可能的完成句拼接到提示中,并对每个 token 的对数概率求和。随后对这些值进行归一化,并与正确的完成句比较,以确定准确率。

案例研究:WinoBias 中的性别偏见

为了展示该工具的能力,Hugging Face 使用 WinoBias 数据集评估了多种 OPT 模型,该数据集衡量与职业相关的性别偏见。在此任务中,模型必须选择正确的代词(刻板印象式或反刻板印象式)来完成包含特定职业的句子。

评估显示出一种“逆向缩放”趋势:较小的模型更倾向于选择反刻板印象代词,而较大的模型更倾向于依赖性别与职业之间的刻板印象关联。该发现与其他基准(如 BIG-Bench)以及先前的研究相吻合,后者表明更大、更强的模型更容易生成有害文本或表现出与种族、民族和国籍相关的偏见。

对 AI 研究和逆向缩放的影响

Evaluation on the Hub 被设计为低代码工具,帮助研究者分析模型在不同维度(如模型规模或 FLOPS)上的行为。由于零样本文本分类任务具有灵活性,任何可以格式化为 Winograd schema(即示例仅在少数词语上不同)的数据集都可用于基准测试。

这种易用性对于研究“逆向缩放问题”尤为有价值,即在特定任务上更大的模型表现不如更小的模型。Hugging Face 鼓励社区使用这些工具来识别此类趋势,并参与诸如 Inverse Scaling Prize 等倡议,该奖项挑战研究者寻找模型规模与性能提升不相关的任务。

Sources