FilBench:评估大型语言模型在菲律宾语言中的能力

Hugging Face 推出了 FilBench,这是一套综合评估工具,旨在评估大型语言模型在塔加洛语、菲律宾语和宿务语方面的流利度、语言能力和文化知识。该基准提供了一种系统化的方法,帮助超越对模型在菲律宾语言流利度的零星证据,建立基于数据的模型性能理解。

FilBench 框架与方法论

FilBench 是一个结构化的评估套件,包含 12 项任务,分为四个主要类别。为了确保基准能够反映真实的 NLP 研究和使用趋势,这些类别是基于对 2006 年至 2024 年初菲律宾语言 NLP 研究的历史调查进行策划的。大多数类别使用未翻译的内容,以保持对语言自然使用的忠实度。

评估类别

  • 文化知识:测试模型回忆事实性和文化特定信息的能力。包括地区知识(Global-MMLU)、以菲律宾为中心的价值观(KALAHI)以及词义消歧(StingrayBench)。
  • 经典 NLP:涵盖信息抽取和语言任务,这些任务传统上由专门模型处理,包括命名实体识别(CebuaNER、TLUnified-NER 和 Universal NER)、文本分类以及情感分析(SIB-200 和 BalitaNLP 的子集)。
  • 阅读理解:通过可读性、理解力和自然语言推理来评估对菲律宾文本的解读(Cebuano Readability Corpus、Belebele 和 NewsPH NLI)。
  • 生成:关注翻译忠实度,特别是从英语到菲律宾语以及从宿务语到英语,使用的数据集包括 NTREX-128、Tatoeba 和 TICO-19。

实现与评分

FilBench 基于 Lighteval 框架构建。研究人员为常见评估术语定义了特定的翻译对(例如,将 "yes" 翻译为 oo,将 "no" 翻译为 hindi),并使用提供的模板实现了自定义任务。最终结果以 FilBench Score 表示,这是基于每个类别示例数量的加权平均值。

LLM 评估的关键发现

对超过 20 种最先进 LLM 的评估揭示了关于它们在菲律宾语言表现的三大主要洞见。

区域特定模型 vs. 通用模型

面向东南亚(SEA)的特定 LLM(如 SEA-LION 和 SeaLLM)是针对菲律宾语言最具参数效率的模型,在相同规模的其他模型中取得了更高的 FilBench 分数。然而,它们仍然被闭源模型(如 GPT-4o)超越。

尽管存在此差距,研究表明,使用 SEA‑specific 指令微调数据持续微调基础 LLM 可带来 2‑3% 的性能提升,这表明针对菲律宾和 SEA 的训练数据策划仍是提升模型的高效方向。

生成与翻译的挑战

生成是所有评估模型中最困难的类别。翻译任务中常见的失败模式包括:

  • 未遵循翻译指令。
  • 生成的文本过于冗长。
  • 出现除塔加洛语或宿务语之外的语言幻觉。

开源权重模型的成本效益

在 Hugging Face 上可获得的开源权重 LLM 为商业模型提供了成本效益高的替代方案,且性能损失不大。对于希望在菲律宾语言任务上寻找 GPT-4o 替代方案的用户,研究人员将 Llama 4 Maverick 视为效率帕累托前沿上的强劲选项。

资源与获取方式

FilBench 作为官方 Lighteval 仓库中的一组社区任务提供。开发者可通过 arXiv(2508.03523)获取完整研究论文,并通过 GitHub 获取评估代码。

Sources