EleutherAI/lm-evaluation-harness
A framework for few-shot evaluation of language models.
解决的问题
本项目提供了一个统一的框架,用于在大量评估任务中测试生成式语言模型。它消除了为不同模型运行单独、碎片化基准测试的需求,使研究人员和开发人员能够使用标准学术基准,一致且可重复地比较 LLM 的性能。
工作原理
该测试工具作为各种模型后端和评估任务库之间的标准化接口。它支持多种模型加载方法,包括 Hugging Face transformers、vLLM、NVIDIA NeMo、Megatron-LM 和商业 API(如 OpenAI)。该框架允许用户通过 CLI 或 Python API 指定模型、一组任务(例如 hellaswag)和配置选项,然后自动处理提示词生成、模型推理和指标计算。
适用人群
它专为 AI 研究人员、LLM 开发人员和组织(例如 NVIDIA、Cohere 和 Mosaic ML)设计,他们需要根据行业标准基准严格评估其模型的能力,以确保可比性以及与 Open LLM Leaderboard 的一致性。
亮点
- 广泛的基准库:包含超过 60 个标准学术基准和数百个子任务。
- 广泛的模型支持:与 Hugging Face、vLLM、Megatron-DeepSpeed、NVIDIA NeMo 和商业 API 兼容。
- 灵活的并行性:支持数据并行评估、模型分片(通过
accelerate)和原生 PyTorch Tensor Parallelism。 - 可定制性:允许自定义提示词、评估指标和基于 YAML 的任务配置。
- 多模态原型设计:对文本+图像多模态输入任务提供实验性支持。
- 行业标准:作为 Hugging Face Open LLM Leaderboard 的后端。
相关
- 项目
- 项目
- 项目
- Dispatch
- 项目