EleutherAI/lm-evaluation-harness

A framework for few-shot evaluation of language models.

解决的问题

本项目提供了一个统一的框架,用于在大量评估任务中测试生成式语言模型。它消除了为不同模型运行单独、碎片化基准测试的需求,使研究人员和开发人员能够使用标准学术基准,一致且可重复地比较 LLM 的性能。

工作原理

该测试工具作为各种模型后端和评估任务库之间的标准化接口。它支持多种模型加载方法,包括 Hugging Face transformers、vLLM、NVIDIA NeMo、Megatron-LM 和商业 API(如 OpenAI)。该框架允许用户通过 CLI 或 Python API 指定模型、一组任务(例如 hellaswag)和配置选项,然后自动处理提示词生成、模型推理和指标计算。

适用人群

它专为 AI 研究人员、LLM 开发人员和组织(例如 NVIDIA、Cohere 和 Mosaic ML)设计,他们需要根据行业标准基准严格评估其模型的能力,以确保可比性以及与 Open LLM Leaderboard 的一致性。

亮点

  • 广泛的基准库:包含超过 60 个标准学术基准和数百个子任务。
  • 广泛的模型支持:与 Hugging Face、vLLM、Megatron-DeepSpeed、NVIDIA NeMo 和商业 API 兼容。
  • 灵活的并行性:支持数据并行评估、模型分片(通过 accelerate)和原生 PyTorch Tensor Parallelism。
  • 可定制性:允许自定义提示词、评估指标和基于 YAML 的任务配置。
  • 多模态原型设计:对文本+图像多模态输入任务提供实验性支持。
  • 行业标准:作为 Hugging Face Open LLM Leaderboard 的后端。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目