3LM:面向阿拉伯语大型语言模型的STEM与代码基准
3LM(علم)是一套多组件基准,旨在评估阿拉伯语大型语言模型(LLMs)在 STEM(科学、技术、工程和数学)学科以及代码生成方面的表现。它填补了阿拉伯语自然语言处理中的关键空白,此前的评估主要集中在情感分析、摘要等通用任务,而非结构化推理和形式逻辑。
基准组件
3LM 包含三个不同的数据集,针对不同的评估维度,以提供模型在技术领域能力的全面视图。
1. 本土 STEM
本土 STEM 包含 865 道多项选择题(MCQs),来源于真实的阿拉伯语教育材料,包括教材、练习册以及 8 至 12 年级的考试题库。数据集覆盖五个核心学科:物理、化学、生物、数学和地理。每道题均附带领域和难度元数据(难度评分 1–10)。创建流程使用了 OCR、通过 Pix2Tex 的 LaTeX 数学解析、LLM 辅助抽取以及人工审查。
2. 合成 STEM
为了测试更高难度的推理并降低答案偏差,合成 STEM 组件包含 1,744 道使用 YourBench 流水线生成的 MCQs。该过程包括对阿拉伯语教材文本进行分块和摘要,然后作为 LLM 驱动的题目生成系统的输入。生成的问题侧重于中高难度的概念、分析和应用类问题,并通过人工审查进行验证。
3. 阿拉伯语代码基准
3LM 引入了首个用于测试阿拉伯语 LLM 在自然语言编程提示上的代码数据集,这些数据集通过翻译和改编 HumanEval+ 与 MBPP+ 基准实现。提示翻译使用了 GPT-4o,并通过回译流水线(剔除 ROUGE-L F1 < 0.8 的样本)和人工过滤确保质量。为保持评分的真实性,原始代码和测试套件保持不变,评估采用 EvalPlus 框架的 pass@1 与 pass@1+ 指标。
关键评估结果
对超过 40 种 LLM 的评估显示,不同任务形式和模型之间的优势各不相同。
- 多项选择题: Qwen2.5-72B-Instruct 达到最高性能,在本土 STEM 上得分 71.8%,在合成 STEM 上得分 67.0%。
- 生成式完成: Gemma-3-27B 在 STEM 答案上表现最强,准确率为 43.2%。
- 代码生成: GPT-4o 在基准中领先,HumanEval-ar 的 pass@1+ 为 83.5%,MBPP-ar 的 pass@1+ 为 63.6%。
分析显示,阿拉伯语和英语的 pass@1 分数之间存在高度相关性(约 0.97),表明语言特定提示的质量对模型结果有显著影响。此外,在受到干扰扰动时,指令微调模型的稳定性显著高于基础模型。
实现与工具
3LM 旨在实现可复现性,并与标准评估工具集成:
- lighteval: 用于 STEM 数据集的多项选择题和开放式问题评估。
- evalplus: 通过函数级测试实现稳健的 pass@1 与 pass@1+ 代码评分。
所有评估脚本、配置和流水线均已在 GitHub 上公开,支持任何兼容 OpenAI API 或 HuggingFace Transformers 的模型。
数据集获取
所有 3LM 数据集均为开源,可在 HuggingFace Datasets 上获取:
3LM-native-stem3LM-synthetic-stem3LM-code-arabic