Hugging Face 开放排行榜(针对希伯来语 LLM)
Hugging Face 推出了针对希伯来语大型语言模型(LLM)的开放排行榜,以提供一个标准化的评估框架,填补通用 LLM 基准在该语言上常常不足的空白。此举旨在通过解决希伯来语特有的形态复杂性,推动语言和文化上更准确的模型发展。
解决希伯来语语言挑战
希伯来语是一种形态丰富的语言,拥有复杂的词根与词形变化系统,前缀、后缀和中缀会改变词义、时态和复数形式。传统的分词策略往往针对形态较为简单的语言设计,对希伯来语的效果常常不佳。这导致现有 LLM 在处理该语言细微差别时表现受限,需要专门的基准来反映这些独特的语言特性。
评估指标与基准
排行榜使用四个关键数据集来测试对希伯来语的理解与生成能力。这些基准采用 few‑shot 提示格式,确保模型能够在有限上下文下进行适配并给出正确响应。
Hebrew Question Answering
此任务评估模型理解希伯来语句法和语义的能力,并在提供的上下文中准确检索答案。使用 HeQ 数据集的测试子集。
Sentiment Accuracy
该基准衡量模型根据语言线索将希伯来语陈述分类为积极、消极或中性。使用 Hebrew Sentiment 数据集。
Winograd Schema Challenge
此任务测量模型通过逻辑推理和通用世界知识解决代词指代和上下文歧义的能力。使用 Dr. Vered Schwartz 提供的 Winograd Schema Challenge 的希伯来语翻译版。
Translation
该基准评估模型在英‑希双向翻译中的熟练程度,关注语言准确性、流畅度以及意义保持。使用 NeuLabs-TedTalks 对齐翻译语料库。
技术实现
排行榜基于 Demo Leaderboard template 构建,灵感来源于 Open LLM Leaderboard。技术流水线如下运行:
- Deployment:提交的模型通过 Hugging Face Inference Endpoints 自动部署。
- Evaluation:模型通过 lighteval 库管理的 API 请求进行评估。
赞助与合作
本项目由 DDR&D IMOD / The Israeli National Program for NLP in Hebrew and Arabic 赞助,并与 DICTA: The Israel Center for Text Analysis 与 Webiks 合作。Bar‑Ilan University 的 Prof. Reut Tsarfaty 提供了科学咨询与指导。