QIMMA:质量优先的阿拉伯语大型语言模型排行榜
QIMMA 是一个全新的阿拉伯语大型语言模型(LLM)排行榜,在评估模型之前先对基准进行验证,以确保报告的分数真实反映阿拉伯语语言能力。它通过在模型测试前对数据集应用多阶段验证流水线,解决了现有阿拉伯语 NLP 评估中普遍存在的碎片化和质量问题。
解决阿拉伯语 NLP 评估中的碎片化问题
阿拉伯语 NLP 评估历来碎片化且质量问题频发。QIMMA 识别出当前环境中的四大主要痛点:
- 翻译伪影:许多基准是从英文翻译而来,导致分布偏移和文化不匹配的问题。
- 缺乏验证:本土阿拉伯语基准往往缺少严格的质量检查,导致标注不一致和错误的金标准答案。
- 可复现性缺口:缺少公开的评估脚本和逐样输出,使得审计结果变得困难。
- 覆盖范围缺失:现有排行榜往往只聚焦于狭窄领域或孤立任务。
QIMMA 通过开源、使用 99% 本土阿拉伯语内容、实施系统化质量验证(包括代码评估)以及提供公开的逐样推理输出,彰显其独特性。
QIMMA 数据集与领域覆盖
QIMMA 将来自 14 个源基准的 109 个子集整合为一个统一套件,包含超过 52,000 条样本。评估覆盖七个不同领域和三种任务类型:
| 领域 | 基准 | 任务类型 |
|---|---|---|
| 文化 | AraDiCE-Culture, ArabCulture, PalmX | MCQ |
| STEM | ArabicMMLU, GAT, 3LM STEM | MCQ |
| 法律 | ArabLegalQA, MizanQA | MCQ, QA |
| 医学 | MedArabiQ, MedAraBench | MCQ, QA |
| 安全 | AraTrust | MCQ |
| 诗歌与文学 | FannOrFlop | QA |
| 编码 | 3LM HumanEval+, 3LM MBPP+ | Code |
值得注意的是,QIMMA 是首个通过阿拉伯语适配版 HumanEval+ 和 MBPP+ 集成代码评估的阿拉伯语排行榜,能够使用阿拉伯语问题陈述来评估编码能力。
质量验证流水线
QIMMA 使用多阶段验证流水线,在任何模型评估之前清理基准数据。
阶段 1:多模型自动评估
两款最先进的 LLM——Qwen3-235B-A22B-Instruct 和 DeepSeek-V3-671B——独立地依据 10 分制评分标准为每个样本打分。如果任一模型的得分低于 7/10,则该样本被剔除。若仅有一个模型标记样本,则进入人工审查。
阶段 2:人工标注与审查
具备文化和方言熟悉度的阿拉伯语母语者审查被标记的样本。这些标注者对方言细微差别、文化背景和主观解释作出最终决定,以确保真实答案准确且具文化敏感性。
阿拉伯语基准的系统性质量问题
验证流水线显示,质量问题是系统性的而非孤立的。不同基准的剔除率各不相同,其中 ArabicMMLU 的剔除率最高,为 3.1%(436 条样本),而 MizanQA 为 2.3%(41 条样本)。
问题被归类为以下四类:
- 答案质量:事实错误的答案或金标准索引不匹配。
- 文本与格式质量:拼写/语法错误、文本损坏或重复样本。
- 文化敏感性:单一化的概括或强化刻板印象。
- 金标准答案合规性:金标准答案与评估协议不一致。
代码基准的细化
由于代码基准不能简单剔除,团队对 3LM 适配的 HumanEval+ 和 MBPP+ 中的阿拉伯语问题陈述进行了细化。结果显示,88% 的 3LM HumanEval+ 提示和 81% 的 3LM MBPP+ 提示被修改,以提升语言精炼、清晰度和结构纠正。
评估框架与指标
QIMMA 使用 LightEval、EvalPlus 和 FannOrFlop 作为评估框架,以确保可复现性。指标根据任务类型分配:
- MCQ:归一化对数似然准确率。
- 多选 MCQ:金选项上的概率质量。
- 生成式 QA:F1 BERTScore(使用 AraBERT v02)。
- 代码:Pass@1。
提示采用六种模板类型(MCQ、MCQ-C、MCQ-I、QA、QA-C、QA-F)标准化,全部使用阿拉伯语编写。
排行榜结果与洞察
截至 2026 年 4 月,表现最好的模型包括:
- 整体领跑者:Qwen/Qwen3.5-397B-A17B-FP8(平均分 68.06)。
- 文化与语言专家:Jais-2-70B-Chat 在 ArabicMMLU 和 ArabCulture 中领先。
- 领域专家:Karnak 在 3LM STEM 和 ArabLegalQA 中领先。
- 编码表现:多语言模型,尤其是 Qwen3.5-397B,仍在编码任务中保持领先。
从结果中得到的关键发现包括:模型规模并不必然保证在所有领域的最佳表现,且阿拉伯语专用模型常常在文化和语言任务上超越规模相当的多语言模型。