开放阿拉伯LLM排行榜 2
Overview
Hugging Face及其合作伙伴推出了开放阿拉伯LLM排行榜2(OALL v2),这是一个经过改进的基准平台,旨在提供对支持阿拉伯语的大型语言模型(LLM)更准确、透明的评估。更新将重点从机器翻译任务转移到本地阿拉伯基准,以更好地捕捉该语言复杂的形态学、语法和文化细微差别。
Addressing Limitations of Arabic Benchmarking
以前的阿拉伯LLM排行榜常常受到资源限制的影响,用户不得不依赖模型制作者的文档而不是直接比较,并且由于缺乏对提交结果的集中验证而导致完整性问题。
OALL v2专门解决了在第一版排行榜及其他社区倡议中发现的不足:
- 减少翻译偏差:许多v1任务是直接从英文翻译而来,这引入了语言不匹配,未能反映真实世界的阿拉伯使用场景。
- 基准饱和:几个v1基准在模型接近满分时变得效果不佳,使得无法区分渐进的改进。
- 技术更正:AlGhafa任务中的一个错误已被修复;之前,系统根据选择文本而非索引来评估响应,这导致较小或较弱的模型被不成比例地惩罚,最高可达20分。
New and Retained Benchmarks in OALL v2
OALL v2遵循两项指导原则:移除饱和和机器翻译的任务,并添加高质量的本地或人工策划的基准。
Retained Datasets
从原始OALL中,排行榜保留了来自AlGhafa基准的本地阿拉伯数据集(包括Facts-Balanced、SOCAL、XGLUE、Sentiment和Sentiment-Rating的人工策划版本),Belebele(阿拉伯MSA和阿拉伯方言),以及阿拉伯EXAMS基准。
New Datasets
- 本地阿拉伯MMLU:包含约15,000道现代标准阿拉伯语(MSA)的多选题,来源于学校考试的40个任务。
- 人工翻译的MMLU(MMLU-HT):原始英文MMLU的57任务人工翻译,由Inception作为JAIS项目的一部分策划。
- MedinaQA:一个专注于一般阿拉伯语言和语法方面的数据集。
- AraTrust:522道由人类编写的多选题,用于评估安全性和真实性。
The ALRAGE Benchmark
OALL v2引入了ALRAGE(阿拉伯语检索增强生成评估),这是一个用于评估阿拉伯语RAG能力的框架。
- 数据集:来源于40本涵盖多样主题的阿拉伯书籍,使用Meta-Llama-3.1-70B进行合成生成,并通过与Argilla的社区冲刺由母语者进行验证。
- 方法论:它通过
lighteval框架使用“LLM-as-judge”度量。Qwen2.5-72B-Instruct担任评判者,基于准确性、相关性和质量在0-10的评分规则上对响应进行评分,然后将其归一化到0-1范围。
Performance Analysis and Results
OALL v1和OALL v2之间的统计比较表明,新基准如AraTrust、ALRAGE和更新后的AlGhafa在不同模型规模上的表现更为分散,而较旧的任务如ACVA和Toxigen则表现出显著的饱和。
Model Rankings
- 顶尖表现者:Llama-3.3-70B-Instruct在OALL v2的所有类别中脱颖而出,成为领导者。
- 预训练模型:Qwen系列模型继续作为强基线;具体来说,Qwen/Qwen2-72B超过了Qwen/Qwen2.5-72B,成为顶尖的预训练/持续预训练模型。
- 跨排行榜相关性:OALL v2与其他排行榜如AraGen和SEAL阿拉伯之间存在显著相关性,Llama-3.3-70B-Instruct在OALL v2和AraGen上均排名第一。
Model Family Trends
对AceGPT和Jais系列的分析表明,较大的模型通常能获得更高的平均分数。然而,一个显著的例外是inceptionai/jais-family-30b-8k模型,它在OALL v2上超过了更大的inceptionai/jais-adapted-70b模型。
Operational Changes
为了确保计算资源的公平访问并鼓励参与组织的多样性,OALL v2现在将每周每个组织的提交限制为五个模型。此外,排行榜现在支持聊天模板;如果在模型配置中找到模板,则将其用于评估。