介绍开放阿拉伯语大型语言模型排行榜

Hugging Face 与技术创新研究所(TII)推出了开放阿拉伯语大型语言模型排行榜(OALL),这是一个专门用于评估和比较阿拉伯语大型语言模型(LLMs)性能的平台。该倡议旨在弥补自然语言处理(NLP)资源的差距,过去评估工具主要偏向英语,为超过 3.8 亿阿拉伯语使用者提供了一个标准化的模型改进途径。

综合基准数据集

OALL 使用多样且可靠的数据集,以确保对模型在各种语言任务上的能力进行全面评估:

  • AlGhafa 基准: 由 TII LLM 团队开发,该基准评估阅读理解、情感分析和问答。它包括 11 个阿拉伯语原生数据集以及 11 个广泛采用的英文 NLP 基准的翻译版本。
  • ACVA 与 AceGPT 基准: 包含来自《AceGPT,阿拉伯语大型语言模型本地化》论文的 58 个数据集,以及 MMLU 和 EXAMS 基准的翻译版本,以覆盖广泛的语言复杂性和细微差别。

评估指标与技术架构

排行榜采用 归一化对数似然准确率 作为主要指标。此选择特别适用于基准数据集中使用的多项选择和是/否问题格式,能够在不同任务类型之间提供公平的性能衡量。

在技术实现上,OALL 基于以下技术栈构建:

  • 框架: 使用 lighteval 库进行评估。团队通过 PR #44 和 PR #95 将阿拉伯语基准集集成到 lighteval 中,以便社区能够直接进行评估。
  • 架构: 前端和后端的设计灵感来源于 demo-leaderboard,后端在 TII 集群本地托管。

模型提交指南

为维护排行榜的完整性,参与者必须遵循模型提交的特定技术要求:

  • 精度对齐: 模型的精度必须与原始模型保持一致,以确保正确的展示和评估。
  • 兼容性: 模型必须能够通过 AutoClasses(AutoConfig、AutoModel、AutoTokenizer)加载,并设置为公开可见。
  • 权重格式: 权重必须转换为 safetensors,以实现更快的加载并在扩展查看器中显示参数数量。
  • 授权许可: 仅接受开放授权的模型,以促进可访问性。
  • 文档: 需要提供完整的模型卡,因为这些信息会自动提取用于排行榜展示。

未来路线图与社区目标

OALL 团队计划通过以下几个即将开展的项目扩展平台的范围:

  • 专属排行榜: 开发新类别,包括针对检索增强生成(RAG)场景的排行榜,以及基于用户偏好的 ELO 分数的聊天机器人竞技场。
  • OpenDolphin 基准: 开放式复现《Dolphin:阿拉伯语自然语言生成的挑战性与多样性基准》论文,将包含约 50 个数据集。
  • 跨语言应用: 该项目旨在成为为其他资源匮乏语言创建类似大规模、语言特定排行榜的蓝图,以弥合全球 NLP 资源的差距。

Sources