开放 Ko-LLM 排行榜
TL;DR
Hugging Face 和 Upstage 推出了 Open Ko-LLM 排行榜,这是一个专门的评估平台,旨在为韩语大语言模型(LLMs)打造透明且具有竞争力的生态系统。通过使用私有测试集和针对韩语的基准,排行榜旨在防止数据污染,并准确衡量韩语的语言和文化细微差别。
通过私有测试集实现公平基准
Open Ko-LLM 排行榜通过采用封闭的测试集环境,使其区别于传统基准。虽然许多排行榜使用开放测试集,但 Open Ko-LLM 排行榜将数据集保持为私有,以防止测试集污染——这是一种模型在评估数据上进行训练的常见问题——并确保模型之间的比较更加公平。
为了确保文化和语言的相关性,平台使用了已翻译的基准数据集,例如 Ko-MMLU,这些数据集专门针对韩语的独特属性和文化进行调整。
评估任务与指标
排行榜采用五种不同的评估方法来衡量 LLM 的广泛能力:
- Ko-ARC (AI2 推理挑战): 一项多项选择测试,用于评估科学思维、复杂推理和问题解决能力。性能通过准确率来衡量。
- Ko-HellaSwag: 评估情境理解以及预测最可能的下一情景的能力,可采用生成式或多项选择形式。准确率是主要指标。
- Ko-MMLU(大规模多任务语言理解): 跨多个主题和领域的广泛多项选择测试,用于衡量通用语言理解和多样性。指标包括整体准确率和特定领域的表现。
- Ko-Truthful QA: 一项多项选择基准,测试模型从选项中辨别事实准确性和真实性的能力,使用选择准确率进行衡量。
- Ko-CommonGEN V2: 为 Open Ko-LLM 排行榜专门开发的自定义基准,用于评估模型是否能够生成符合韩语常识和文化相关性的输出。
采用情况与模型性能趋势
自发布以来的五个月内,Open Ko-LLM 排行榜已收到超过 1,000 份模型提交,达到原始英文 Open LLM 排行榜(拥有超过 4,000 个模型)四分之一的规模。参与者包括个人研究者、学术机构(如 KAIST 和高丽大学)以及企业(包括 KT、乐天信息通信和 Yanolja)。
关键性能观察包括:
- Top Performers(顶尖模型): 经过跨语言迁移或韩语特定微调的模型(例如 Upstage 的 SOLAR),以及从强大的基础模型如 LLaMa2、Yi 和 Mistral 微调的模型表现最为出色。
- Notable Milestones(显著里程碑): KT 的 Mi:dm 7B 模型在参数为 7B 或以下的模型中排名第一,并已对公众开放使用。
基础设施挑战与未来愿景
排行榜目前运行在 16 块 A100 80GB GPU 上。该基础设施对参数超过 300 亿的模型构成瓶颈,这些模型常因高计算需求而导致长时间的等待状态。
展望未来,组织者计划发展排行榜,以解决当前基准评估的三大主要限制:
- 数据陈旧: 超越固定数据集(如 SQUAD 和 KLEU),引入反映当前时态的数据。
- 真实世界应用: 开发衡量模型处理 B2B 和 B2C 服务中边缘案例和异常值能力的方法。
- 过拟合: 减少“排行榜中心化”做法,即模型仅针对测试集进行调优,而非真实世界的实用性。
最终目标是通过引入与真实使用场景高度相关的基准,弥合学术研究与实际应用之间的鸿沟。