Hugging Face 和 LLM-jp 发布开放的日语 LLM 排行榜

Hugging Face 和 LLM-jp 研究联盟推出了开放的日语 LLM 排行榜,以提供一个集中且透明的系统,用于评估日语中的大型语言模型(LLMs)的性能。此举旨在填补一种语言缺乏开放基准标准的空白,这种语言具有独特的语言挑战,包括复杂的书写系统和没有单词边界。

综合评估套件

开放的日语 LLM 排行榜使用 llm-jp-eval 库来评估模型在 16 项不同任务上的表现,任务范围从经典 NLP 到现代推理。这些任务采用 4-shot 提示执行。评估套件包括语言学家和专家从零开发的数据集,以及根据日语文化和语言特点进行调整的自动翻译数据集。

关键评估数据集

  • Jamp: 自然语言推理(NLI)的时间推理基准,测试蕴含、中性和矛盾。
  • JEMHopQA: 旨在评估内部推理和推导生成的多跳问答数据集。
  • jcommonsenseqa: 用于评估一般常识推理的 CommonsenseQA 的日语版本。
  • chABSA: 基于日本上市公司 2016 财年财务报告的方面情感分析数据集,遵循金融服务局(FSA)分类法。
  • mbpp-ja: 通过 DeepL 从 Mostly Basic Python Problems(MBPP)数据集翻译而来的编程数据集。
  • mawps: 一个数学评估数据集,专注于基本算术和方程的逐步思维链(CoT)推理,已针对日语环境进行调整。
  • JMMLU: 基于 MMLU 部分的知识数据集,已针对日语公民知识、地理和习惯用法进行调整。
  • XL-Sum: 利用 BBC News 文章日语翻译的抽象摘要数据集。

技术实现

排行榜的架构受到开放 LLM 排行榜的启发。技术栈包括:

  • Deployment: 通过 Hugging Face 推理端点进行自动部署。
  • Evaluation Framework: llm-jp-eval 库(版本 1.14.1)。
  • Inference Engine: vLLM(版本 v0.6.3),用于内存高效的服务。
  • Compute Backend: 日本的 mdx 高级研究计算平台。

性能观察

对排行榜的分析揭示了日语 LLM 生态系统中的几个趋势:

  • 架构偏好:Meta 的 Llama 架构在日本 AI 实验室中广受青睐,尽管 Mistral 和 Qwen 架构也取得了顶尖得分。
  • 开源 vs. 闭源:开源架构正在缩小与闭源模型之间的差距。例如,由 LLM-jp 开发的 llm-jp-3-13b-instruct 模型的性能与闭源替代方案相当。
  • 剩余挑战:大多数 LLMs 在特定领域任务上仍然遇到困难,包括金融(chABSA)、语言注释(Wikipedia Annotated Corpus)、代码生成(mbpp-ja)和摘要生成(XL-Sum)。
  • 文化一致性:由日本公司或实验室开发的模型在 JCommonsenseMorality 数据集上表现更好,该数据集测试模型做出符合日本价值观的道德选择的能力。

未来路线图

评估框架将随 llm-jp-eval 工具一起发展。计划的增强包括:

  • 扩展数据集:集成 JHumanEval(HumanEval 的日语版本)和 MMLU
  • 高级评估:实施思维链(CoT)评估,以与基本提示进行性能比较。
  • 新指标:引入“超出选择率”来衡量模型预测超出提供标签的标记的频率,作为遵循指令能力的代理。

Sources