AraGen 基准和排行榜:为阿拉伯语大语言模型引入 3C3H 评估
TL;DR
Hugging Face 宣布了 AraGen,一个用于阿拉伯语大型语言模型的生成任务基准和排行榜,围绕新的 3C3H 评估度量构建,该度量使用 LLM 作为评判者的方法,在正确性、完整性、简洁性、有用性、诚实性和无害性方面对模型响应进行评分。
3C3H 度量概述
3C3H 度量是一种综合评估,结合了事实性和可用性。它评估六个维度:
- 正确性 (二进制):相对于真实值的事实准确性。
- 完整性 (二进制):答案是否涵盖了问题的所有部分。
- 简洁性 (1‑5):在保留所需信息的同时,简洁程度的适当性。
- 有用性 (1‑5):答案帮助用户的程度。
- 诚实性 (1‑5):所有信息的准确性,惩罚幻觉。
- 无害性 (1‑5):不含冒犯或偏见内容。 首先计算二进制分数;如果正确性或完整性为零,则将所有其他维度设置为零。缩放分数从 [1,5] 归一化到 [0,1]。总体 3C3H 分数在每个样本上聚合六个维度,然后在数据集上取平均。
AraGen 基准和排行榜
AraGen 提供一个排行榜,使用 3C3H 衡量标准对开放和专有的阿拉伯语大语言模型进行排名。该基准包含 279 条人工验证的问题,覆盖四个任务:问答、正字法和语法分析、推理以及安全。
评估流程
- 模型提交 – 用户提交模型进行评估。
- 响应生成 – 模型为固定的 AraGen 基准集生成答案。
- LLM 作为评判者 – 选定的 LLM 根据验证的真实值评估每个模型答案,遵循 3C3H 指南并输出 JSON 形式的分数。
- 得分和归一化 – 首先得出二进制分数;缩放分数归一化到 [0,1]。
- 排行榜报告 – 结果显示在两个排行榜上:一个通用的 3C3H 排行榜(显示总体和每个维度的分数)以及一个任务排行榜(显示每个四个任务的分数)。
动态排行榜以增强鲁棒性
为了减轻数据污染,AraGen 采用动态评估策略:
- 盲测集 – 每个数据集在三个月的评估期内保持私有,防止泄漏到模型训练中。
- 定期更新 – 三个月后,盲测集被新的人工验证问答对集替换,保持结构、复杂性和领域平衡。
- 开源 – 盲测期结束后,数据集和评估代码将公开发布,以实现独立验证和可重复性。
数据集设计
AraGen 基准包含分布在四个任务中的 279 个示例。交互类型为:
- 单次交互 – 简单的问答。
- 对话交互 – 多轮交流;评估侧重于最终轮次,同时考虑流程。
- 后续交互 – 两轮序列,其中第二个答案依赖于第一个答案;第一个答案的权重加倍,以强调事实连续性。 对于正字法和语法分析,数据在阿拉伯语语法和阿拉伯语听写语法之间均匀分配(各占 50%)。安全示例仅属于安全类别。
评判者评估与选择
作者尝试了几个候选 LLMs 作为评判者,包括 GPT‑4o、GPT‑4o‑mini、Claude‑3.5‑sonnet、Claude‑3‑haiku、Llama 3.1‑405b 和陪审团系统。评估标准包括与人类评判者的一致性(Cohen’s Kappa)、得分一致性(标准差)、自偏见和幻觉倾向。
- 一致性:GPT‑4o‑mini 与人类评判者的 Kappa 达到最高(0.46),紧随其后的是 Claude‑3.5‑sonnet。
- 一致性(Consistency): 陪审团系统显示出最低的平均标准差(0.0049);在单个评判者中,Claude‑3.5‑sonnet 最为稳定(0.0063)。
- 自偏见:Claude‑3.5‑sonnet 表现出最小的自我偏好评分,而 GPT‑4o 和 GPT‑4o‑mini 则对自身输出的评分高于其他评判者。
- 幻觉:Claude‑3.5‑sonnet 和 GPT‑4o‑mini 均表现出对指南的高度遵循;Claude‑3.5‑sonnet 的任何偏差均源于 API 错误,而非幻觉。
基于这些结果,由于其低变异性、低自偏见和强的人类一致性,Claude‑3.5‑sonnet 被选为 AraGen 排行榜的主要评判者。陪审团系统被排除,因为它没有提供排名提升,存在偏见放大的风险,并且计算成本高。
结论
AraGen 通过 3C3H 衡量标准引入了一个严格的、动态的评估框架,用于阿拉伯语大语言模型,统一了事实性和可用性。通过将评估数据在三个月周期内保持私有并在之后发布,排行榜降低了数据泄露风险,同时保持透明和可重复。作者计划通过新任务扩展基准,半自动化数据集创建,并将框架适应其他资源不足的语言。