Hugging Face 和 LLM-jp 发布开放的日语 LLM 排行榜
Hugging Face 和 LLM-jp 研究联盟推出了开放的日语 LLM 排行榜,以提供一个集中且透明的系统,用于评估日语中的大型语言模型(LLMs)的性能。此举旨在填补一种语言缺乏开放基准标准的空白,这种语言具有独特的语言挑战,包括复杂的书写系统和没有单词边界。
综合评估套件
开放的日语 LLM 排行榜使用 llm-jp-eval 库来评估模型在 16 项不同任务上的表现,任务范围从经典 NLP 到现代推理。这些任务采用 4-shot 提示执行。评估套件包括语言学家和专家从零开发的数据集,以及根据日语文化和语言特点进行调整的自动翻译数据集。
关键评估数据集
- Jamp: 自然语言推理(NLI)的时间推理基准,测试蕴含、中性和矛盾。
- JEMHopQA: 旨在评估内部推理和推导生成的多跳问答数据集。
- jcommonsenseqa: 用于评估一般常识推理的 CommonsenseQA 的日语版本。
- chABSA: 基于日本上市公司 2016 财年财务报告的方面情感分析数据集,遵循金融服务局(FSA)分类法。
- mbpp-ja: 通过 DeepL 从 Mostly Basic Python Problems(MBPP)数据集翻译而来的编程数据集。
- mawps: 一个数学评估数据集,专注于基本算术和方程的逐步思维链(CoT)推理,已针对日语环境进行调整。
- JMMLU: 基于 MMLU 部分的知识数据集,已针对日语公民知识、地理和习惯用法进行调整。
- XL-Sum: 利用 BBC News 文章日语翻译的抽象摘要数据集。
技术实现
排行榜的架构受到开放 LLM 排行榜的启发。技术栈包括:
- Deployment: 通过 Hugging Face 推理端点进行自动部署。
- Evaluation Framework:
llm-jp-eval库(版本 1.14.1)。 - Inference Engine: vLLM(版本 v0.6.3),用于内存高效的服务。
- Compute Backend: 日本的 mdx 高级研究计算平台。
性能观察
对排行榜的分析揭示了日语 LLM 生态系统中的几个趋势:
- 架构偏好:Meta 的 Llama 架构在日本 AI 实验室中广受青睐,尽管 Mistral 和 Qwen 架构也取得了顶尖得分。
- 开源 vs. 闭源:开源架构正在缩小与闭源模型之间的差距。例如,由 LLM-jp 开发的
llm-jp-3-13b-instruct模型的性能与闭源替代方案相当。 - 剩余挑战:大多数 LLMs 在特定领域任务上仍然遇到困难,包括金融(
chABSA)、语言注释(Wikipedia Annotated Corpus)、代码生成(mbpp-ja)和摘要生成(XL-Sum)。 - 文化一致性:由日本公司或实验室开发的模型在
JCommonsenseMorality数据集上表现更好,该数据集测试模型做出符合日本价值观的道德选择的能力。
未来路线图
评估框架将随 llm-jp-eval 工具一起发展。计划的增强包括:
- 扩展数据集:集成
JHumanEval(HumanEval 的日语版本)和MMLU。 - 高级评估:实施思维链(CoT)评估,以与基本提示进行性能比较。
- 新指标:引入“超出选择率”来衡量模型预测超出提供标签的标记的频率,作为遵循指令能力的代理。