Alyah:阿联酋方言基准用于阿拉伯语大型语言模型
TL;DR
Hugging Face 与合作伙伴发布了 Alyah,一个专门用于评估大型语言模型(LLMs)处理阿联酋方言的基准。此发布填补了阿拉伯语自然语言处理中的关键空白,因为大多数现有基准侧重于现代标准阿拉伯语(MSA),导致文化丰富且主要以口语形式存在的阿联酋方言未得到充分评估。
Alyah 基准:范围与动机
Alyah(在阿联酋方言中意为“北极星”)旨在超越表层词汇知识,测试模型解释文化嵌入意义、语用使用以及方言特有细微差别的能力。由于阿联酋方言与当地遗产、诗歌和口头叙事紧密相连,常常包含无法通过对现代标准阿拉伯语的字面翻译推断出的表达。
数据集组成
该基准由 1,173 条手工收集的样本 组成,来自阿联酋本土说话者,以确保语言真实性。每条样本为一个四选一的选择题,提供四个候选答案(一个正确,三个经可行性审查的合成干扰项)。
数据集被划分为七个类别,难度各不相同:
| 类别 | 样本数量 | 难度 |
|---|---|---|
| 语言与方言 | 619 | 困难 |
| 礼仪与价值观 | 173 | 中等 |
| 意象与隐喻意义 | 121 | 中等 |
| 历史与遗产知识 | 89 | 困难 |
| 宗教与社会敏感性 | 78 | 中等 |
| 问候与日常表达 | 61 | 容易 |
| 诗歌与创意表达 | 32 | 困难 |
模型评估与方法论
研究人员评估了 54 个语言模型,包括 23 个基础模型和 31 个指令微调模型。评估池涵盖了阿拉伯语本土 LLM(如 Jais、Allam)、具备阿拉伯语支持的多语言模型(如 Qwen、Llama)以及地区专用模型(如 Fanar、AceGPT)。
评分协议
模型的评估基于 语义正确性和适切性,关注阿联酋方言的使用,而非字面文本重叠。每个类别的难度等级通过对模型整体表现的经验观察确定。
关键发现与性能趋势
评估结果显示,尽管部分模型表现良好,但表层熟悉度与深层文化理解之间仍存在显著差距。
指令微调的影响
指令微调模型普遍优于基础模型,尤其在涉及对话规范、礼仪和隐喻意义的类别中表现更佳。这表明对齐和指令微调帮助模型更好地利用其已有的基于现代标准阿拉伯语的意象知识,以应对方言模式。
性能瓶颈
- 最难类别: “语言与方言”以及“问候与日常表达”在所有模型规模中始终是最具挑战性的。这归因于阿联酋方言主要以口语形式存在且很少书写,导致可用于 LLM 的训练数据受限。
- 多语言模型的局限性: 即使是表现出色的多语言模型,在最具挑战性的 Alyah 问题上也出现显著性能下降,这表明方言特定的语义知识难以通过通用的多语言训练获得。
- 阿拉伯语本土模型的优势: 阿拉伯语本土模型在文化根植内容上通常表现更为稳健,尽管在各类别间的表现仍不均衡。
表现最佳的模型
- 基础模型:
google/gemma-3-27b-pt以 74.68% 的准确率领先,其次是tiiuae/Falcon-H1-34B-Base(73.66%。) - 指令微调模型:
falcon-h1-arabic-7b-instruct达到最高准确率 82.18%,其后是humain-ai/ALLaM-7B-Instruct-preview(77.24%。) - 整体表现: 最高得分的大模型是
Jais-2-70B,而在较小模型中,jais-2-8B和ALLaM-7B-instruct表现领先。
对阿拉伯语 LLM 开发的启示
Alyah 作为诊断工具,凸显方言能力是多维度的。模型能够处理隐喻语言并不意味着在诗歌或遗产相关查询上也具备熟练度。该基准旨在指导未来的数据收集和训练工作,以打造更好满足阿联酋用户特定语言和文化需求的模型。