阿拉伯排行榜:阿拉伯指令遵循与 AraGen 更新

Hugging Face 与 Inception 联合穆罕默德·本·扎耶德人工智能大学(MBZUAI)共同推出了 Arabic-Leaderboards Space。该统一平台集中管理阿拉伯语 AI 评估,推出首个公开可用的阿拉伯指令遵循基准,并更新 AraGen 生成式排行榜,以提升阿拉伯语大型语言模型评估的严谨性。

Arabic-Leaderboards Space

Arabic-Leaderboards Space 充当各种模态下阿拉伯语 AI 评估的中心枢纽。目前,平台托管两个主要的实时排行榜:AraGen-03-25Arabic Instruction Following。开发者计划随着研究进展,扩展该空间以包含更多排行榜和任务。

AraGen-03-25 发布与评估

AraGen 是一个用于对生成任务中的大型语言模型进行基准测试的阿拉伯语生成式排行榜。最新发布的 AraGen-03-25 引入了评估框架的若干关键更新。

数据集扩展与分布

AraGen-03-25 数据集已扩展至 340 对问答,较之前的 279 对有所增加。任务分布如下:

  • Question Answering(问答): ~200 对
  • Reasoning(推理): 70 对
  • Safety Questions(安全问题): 40 对
  • Orthographic and Grammatical Analysis(正字法与语法分析): 30 对

动态评估与排名稳定性

为确保可靠性,Inception 采用动态评估周期,数据集在公开前保持三个月私有(盲测)。AraGen-12-24 基准 已公开发布,其中模型响应由 Claude-3.5-Sonnet 按 3C3H 指南进行评估。

对比先前系统提示(SP1)与当前系统提示(SP2)之间的排名变化分析表明,排名总体保持稳定。模型 o1-2024-12-17 始终位居榜首,尽管其绝对得分从 82.67%(AraGen-12-24)下降至 70.25%(AraGen-03-25),这表明更新后的基准显著更具挑战性。

3C3H 评估指标

3C3H 指标基于事实性和可用性评估模型的聊天能力。近期分析的关键发现是正确性、帮助性和无害性之间高度相关,而 conciseness(简洁性) 则是例外。大多数模型因冗长而获得奖励,尽管分析指出 silma-ai/SILMA-9B-Instruct-v1.0 的简洁性高于更大的开源模型,但相较于其基础模型 google/gemma-2-9b-it,帮助性有所下降。

阿拉伯指令遵循(Arabic IFEval)

指令遵循是大型语言模型遵守特定、客观可衡量约束的能力。Inception 推出了 Arabic IFEval,这是首个针对阿拉伯语的公开基准。

数据集构建

受 Google 英文 IFEval 启发,Arabic IFEval 数据集包含约 300 条提示。团队并未进行简单翻译,而是对提示进行改编,以体现阿拉伯语的语言细微差别和文化背景。关键特性包括:

  • Linguistic Challenges(语言挑战): 聚焦阿拉伯语音、正字法和形态学的提示(例如使用变音符号/塔什基尔)。
  • Constraint Types(约束类型): 可验证的指令,如避免使用特定字母(如 Alef)、使用特定词频,或遵守严格的长度和标点约束。
  • Expert Validation(专家验证): 所有提示均由阿拉伯语语言学家验证,以确保语法准确性和清晰度。

评估方法论

评估通过自动化 Python 脚本进行,以确保可复现性并消除 AI 评审偏差。基准采用两级准确度:

  • Prompt-level strict accuracy(提示级严格准确度): 严格指标,仅当提示中的 所有 指令均被遵循时才标记为成功。
  • Instruction-level score(指令级得分): 较宽松的指标,评估部分遵循情况。

性能结果

初步结果比较阿拉伯语与英文 IFEval 的提示级准确度,显示模型在英文上普遍表现更佳。例如,claude-3.5-sonnet 在阿拉伯语排行榜中以 72.5% 的准确度领先,而英文为 84.7%。阿拉伯语的其他顶尖模型包括 gpt-4o-2024-08-06(70.8%)和 gpt-4o-mini-2024-07-18(68.1%)。

未来路线图

Inception 与 MBZUAI 计划持续更新 Arabic-Leaderboards Space。即将加入的内容包括由 camel-benchkitab 支持的视觉问答(VQA)排行榜。

Sources