BenCzechMark:面向捷克语 LLM 的综合评估套件

Hugging Face 与 BUT FIT、FI MUNI 和 CIIRC CTU 合作,推出了 BenCzechMark,这是首个面向捷克语的大型语言模型(LLM)能力的综合评估套件。该基准提供了一个标准化框架,用于衡量推理能力、语法正确性、捷克文化的事实知识以及语言模型概率。

基准组成与任务类别

BenCzechMark 包含 50 项任务,覆盖 9 个类别,其中 90% 内容为原生捷克语,10% 为翻译内容(主要通过 CUBBITT 和 DeepL 完成)。该套件在以下维度上评估模型:

  • 阅读理解:使用 Belebele(Accuracy)和 SQAD3.2(Exact Match)测试从上下文中提取信息的能力。
  • 事实知识:通过 Umimeto(Accuracy)、TriviaQA(Exact Match)和 NaturalQuestions(Exact Match)测试模型的存储知识。
  • 捷克语理解:使用 CERMAT(EM/AUROC/Acc)、Grammar Error Detection(AUC)和 Agree(Accuracy)关注句法和细微差别。
  • 语言建模:通过 Czech National Corpus(Perplexity)和 HellaSwag(Accuracy)衡量文本采样的可能性。
  • 捷克语数学推理:使用 Klokan QA(Accuracy)、CERMAT(Exact Match/Accuracy)和 Umimeto Math(Accuracy)评估问题求解能力。
  • 自然语言推理:使用 Czech SNLI(AUROC)、CSFever(AUROC)、CTKFacts(AUROC)和 Propaganda(AUROC)测试蕴含与支持。
  • 命名实体识别(NER):使用 CNEC2.0(Exact Match)和 Court Decisions(Exact Match)识别实体类型。
  • 情感分析:通过 Subjectivity(AUROC)和 CzechSentiment(AUROC)量化情感。
  • 文档检索:使用 Historical IR(Accuracy)识别相关段落。

评估指标

为处理多样的任务类型,基准采用四种主要指标:

  1. 准确率(Acc):用于多项选择任务。
  2. 完全匹配(EM):用于开放式简短答案生成。
  3. 受试者工作特征曲线下面积(AUROC):用于分类任务,避免阈值校准的需求,确保模型之间更公平的比较。
  4. 词级困惑度(Ppl):用于语言建模任务,以语料库中的每个词进行归一化。

新颖的对决计分机制

由于基准使用了尺度不同的多种指标,简单平均不可行。BenCzechMark 引入了 对决胜分(DWS) 来确定最终排名。

对于每个任务,模型之间使用 α=0.05 的统计显著性检验进行比较。使用的检验包括单尾配对 t 检验(用于 ACC 和 EM)、贝叶斯检验(用于 AUROC)以及自助抽样(用于 Ppl)。模型的 DWS 是其在特定任务上相对于所有其他模型赢得的“对决”比例。最终的综合得分为 宏观平均模型胜率,即各类别 DWS 的平均值。

模型表现与排行榜结果

26 个开源模型(使用 3-shot 示例、2048 token 输入长度,并采用平均池化进行对数概率聚合)的评估揭示了以下关键发现:

  • Llama-405B 在排行榜上整体表现最佳。
  • Qwen-72B 在数学和信息检索方面表现出色,但在其他类别上稍显落后。
  • Aya-23-35B 在情感分析和语言建模方面表现卓越。
  • Gemma-2 9B 在捷克语阅读理解方面超越了显著更大的模型。

研究人员和开发者可通过专门的 Hugging Face Space 将自己的模型提交至 BenCzechMark 排行榜,以推动以捷克语为中心的 LLM 发展。

SUMMARY: Hugging Face 与学术合作伙伴发布了 BenCzechMark,这是首个面向捷克语模型的综合评估套件,包含 9 个类别的 50 项任务,并采用新颖的基于对决的计分机制。

TITLE: BenCzechMark:面向捷克语 LLM 的综合评估套件

Sources